「Claude、GPT、Geminiのうち、結局どれを選べばいいのか」
AIで記事作成やデータ処理を自動化しようとすると、ほぼ必ずこの問題にぶつかります。
しかし、モデル単体のベンチマーク順位だけで選ぶと失敗します。自動運転では文章力だけでなく、API料金、処理時間、形式遵守率、再試行回数、ツール連携、認証エラー、タイムアウトまで含めて採算が決まるからです。
本記事では、2026年7月23日時点の公式情報を基に、次の均衡型モデルを比較します。
- Claude Sonnet 5
- GPT-5.6 Terra
- Gemini 3.6 Flash
さらに、Hiroが運営する本サイトの自動記事生成ログを使い、「どのAIが賢いか」だけでなく「無人実行すると、どこで止まるのか」まで検証します。
結論を先にまとめると、万能な1位はありません。
- 長い指示やエージェント処理の品質を重視するならClaude
- 複雑な業務フローと構造化出力をまとめるならGPT
- マルチモーダル処理や大量バッチを重視するならGemini
- 本番運用では、主担当・検査担当・障害時の代替モデルを分ける
目標は、AIに作業を一度手伝わせることではありません。記事、比較データ、レポート、商品情報などを継続的に生成し、効果測定まで回る「自動化資産」へ組み込むことです。
Claude・GPT・Geminiの違いを比較する前提
Claude、GPT、Geminiは、いずれも大規模言語モデルを中心としたAIサービスです。
初心者向けに言い換えると、文章を書くチャットボットではなく、次の処理を共通の指示形式で実行できるエンジンです。
- 情報の分類
- 長文の要約
- 記事やメールの作成
- 画像・PDF・動画の解析
- JSONなど決められた形式での出力
- 外部ツールやAPIの呼び出し
- コードの作成と検証
注意したいのは、「Claude」「GPT」「Gemini」が単一モデルの名前ではない点です。各社には、高性能モデル、均衡型モデル、低価格モデルがあります。
ブランド名だけを比較するのは、自動車メーカー名だけを見て燃費を比べるようなものです。実務では、少なくとも次の条件をそろえて評価します。
- 正確なモデルID
- APIの入力・出力単価
- 推論設定
- 入力データ
- プロンプト
- 利用するツール
- タイムアウト時間
- 再試行条件
Claude Sonnet 5・GPT-5.6 Terra・Gemini 3.6 Flash比較表
2026年7月23日時点の公式仕様は次のとおりです。
| 比較項目 | Claude Sonnet 5 | GPT-5.6 Terra | Gemini 3.6 Flash |
|---|---|---|---|
| 提供元 | Anthropic | OpenAI | |
| モデルID | claude-sonnet-5 | gpt-5.6-terra | gemini-3.6-flash |
| 主な位置付け | 速度と知能の両立 | 知能とコストの均衡 | 高速なエージェント・マルチモーダル処理 |
| コンテキスト上限 | 100万トークン | 105万トークン | 1,048,576トークン |
| 最大出力 | 12.8万トークン | 12.8万トークン | 65,536トークン |
| 標準入力単価 | 3ドル/100万トークン | 2.50ドル/100万トークン | 1.50ドル/100万トークン |
| 標準出力単価 | 15ドル/100万トークン | 15ドル/100万トークン | 7.50ドル/100万トークン |
| 向いている運用 | 長い指示、制作、コーディング | 複雑な業務フロー、構造化出力 | 高頻度処理、画像・動画・PDF |
Claude Sonnet 5には、2026年8月31日まで入力2ドル・出力10ドル/100万トークンの導入価格が設定されています。9月1日以降は入力3ドル・出力15ドルの標準価格になる予定です。また、新しいトークナイザーにより、同じ文章でもClaude Sonnet 4.6よりトークン数が約30%増える場合があります。Claude Sonnet 5公式資料
GPT-5.6 Terraは、105万トークンのコンテキストと12.8万トークンの最大出力に対応します。入力が272Kトークンを超えるリクエストでは、入力単価が2倍、出力単価が1.5倍になり、割増はリクエスト全体に適用されます。GPT-5.6 Terra公式資料
Gemini 3.6 Flashは、テキスト、画像、動画、音声、PDFを入力でき、標準料金は入力1.50ドル、出力7.50ドルです。出力料金には思考トークンも含まれるため、画面に表示された回答だけで原価を見積もらないようにします。Gemini 3.6 Flash公式仕様/Gemini API料金
料金や仕様は変更される可能性があります。本番導入時には、公式ページとAPIから取得できる実使用量を再確認してください。
API料金を同じ条件で比較する
次の条件で、1回当たりのテキスト生成費用を計算します。
入力:10,000トークン
出力:2,000トークン
検索、画像生成、キャッシュ、税、為替変動は除外
Claudeは2026年8月31日までの導入価格を使用
Geminiは標準料金を使用
計算式は次のとおりです。
1回当たりの概算原価
= 入力トークン ÷ 1,000,000 × 入力単価
+ 出力トークン ÷ 1,000,000 × 出力単価
| モデル | 入力費用 | 出力費用 | 1回の概算原価 | 月10万回 |
|---|---|---|---|---|
| Claude Sonnet 5 | 0.020ドル | 0.020ドル | 0.040ドル | 4,000ドル |
| GPT-5.6 Terra | 0.025ドル | 0.030ドル | 0.055ドル | 5,500ドル |
| Gemini 3.6 Flash | 0.015ドル | 0.015ドル | 0.030ドル | 3,000ドル |
Claudeの標準料金移行後は、同じ条件で1回0.060ドル、月10万回で6,000ドルです。
ただし、この表だけで「Geminiが最も安い」と結論付けることはできません。形式違反や事実誤認による再生成が増えると、表示単価が安いモデルでも最終原価が高くなるからです。
実務では、次の式を使います。
合格成果物1件当たり原価
= API・検索・画像・再試行の総費用
÷ 検査に合格した成果物数
用途別に見るClaude・GPT・Geminiの選び方
Claude:長い指示と自律処理を重視する場合
Claude Sonnet 5は、長い制作ルールを守る文章生成、コーディング、複数ツールをまたぐエージェント処理の候補です。
向いている処理には次があります。
- 複数の資料を読み、矛盾を抽出する
- 長い執筆ルールを守って記事を作る
- リポジトリを調査し、修正とテストを行う
- ツールの実行結果を確認しながら次の処理を判断する
- 100万トークン級のコンテキストを扱う
移行時には注意点があります。
Claude Sonnet 5では適応型思考が標準で有効です。また、手動の拡張思考設定や、非デフォルトのtemperature、top_p、top_kはエラーになる場合があります。
さらに、新しいトークナイザーでは同じ文章のトークン数が従来より増える可能性があります。旧モデルで測った原価表やmax_tokensをそのまま転用せず、実際のプロンプトを再計測してください。
GPT:複雑な業務フローと構造化出力を重視する場合
GPT-5.6 Terraは、データ取得、分析、生成、検査を一つのフローへまとめたい場合の候補です。
向いている処理には次があります。
- データ取得からレポート作成までの連続実行
- JSONスキーマに従った商品データ生成
- コード作成、テスト、修正
- Web検索やファイル検索を使った調査
- コンピューター操作を含む業務フロー
- MCPや関数呼び出しによる外部連携
GPT-5.6 Terraは、noneからmaxまで複数の推論レベルを利用できます。高い推論レベルが常に事業上の最適解とは限りません。
本番データで、少なくとも次の3条件を比較します。
速度重視:reasoning.effort = low
均衡型 :reasoning.effort = medium
難問向け:reasoning.effort = high
品質差が小さいなら、処理時間と原価が低い設定を採用します。
Gemini:画像・動画・PDFと大量処理を重視する場合
Gemini 3.6 Flashは、テキストだけでなく画像、音声、動画、PDFを入力できるマルチモーダルモデルです。
向いている処理には次があります。
- 商品画像から特徴を抽出する
- 大量の記事候補を分類する
- PDFや動画から情報を整理する
- Google検索で情報を補完する
- Google Cloud上の処理と接続する
- 低コストで一次処理を大量実行する
一方、無料枠と有料枠では、レート制限や入力データの扱いが異なります。公式料金ページでは、無料枠のコンテンツはGoogleの製品改善に利用される場合があり、有料枠では利用されないと説明されています。
機密情報を扱う場合は、価格だけでなく、契約プラン、保存条件、リージョン、社内規程を確認してください。
Hiro運営サイトの一次ログで分かったこと
一般的なAI比較記事は、ベンチマーク表を並べて終わりがちです。
本記事では、本サイトのauto-ai-blogリポジトリに保存された自動記事生成ログを確認しました。比較したのはモデルの知能だけではなく、WindowsとPowerShell上でAI CLIを無人実行したときの停止原因です。
検証環境
2026年7月23日に各CLIで--versionを実行した結果は次のとおりです。
Claude Code:2.1.179
Gemini CLI:0.42.0
Codex CLI:0.144.5
OS:Windows
シェル:PowerShell
ログ:generator/logs/generate.log
2026年7月23日の実行結果
実際のログには次の処理が記録されていました。
06:27:39 Codexでドラフト生成を開始
06:30:15 ドラフト生成に成功
06:30:15 Geminiでレビューを開始
06:30:15 Geminiレビューが失敗
06:30:15 Codexレビューへフォールバック
06:33:36 Codexレビューに成功
06:33:36 Codexで最終確認を開始
06:37:33 最終確認に成功
06:37:33 記事ファイルを保存
06:37:36 Notionへの保存に成功
06:37:39 Git pushに成功
ドラフト開始から記事保存までは約9分55秒、Git pushまでは約10分でした。
これは特定のPC、プロンプト、CLI設定、記事テーマにおける1回の結果です。一般的なモデル速度を示すベンチマークではありません。
停止原因はGeminiの文章力ではなかった
Geminiレビューの失敗理由は次のとおりです。
review: gemini CLI failed: The command line is too long.
長い記事とレビュー指示をWindowsのコマンド引数として渡したため、OSまたはCLIのコマンド長制約に当たったと考えられます。
このログだけを見て、「Geminiは長文レビューが苦手」と判断するのは誤りです。モデルへリクエストが正常に届く前の、実行基盤側の問題だからです。
改善候補は次の3つです。
- 長文を標準入力から渡す
- UTF-8の一時ファイルへ保存し、ファイル経由で読み込む
- CLIを介さず、APIのリクエスト本文として送る
別の実行では、Codex CLIが設定された240秒を超えてタイムアウトした記録もあります。また、Gemini CLIでは認証プランや信頼済みディレクトリ設定に起因するエラーも確認されています。
一方、Claude Codeはこの実行フローの生成・レビュー担当に設定されていませんでした。そのため、このログからClaude、GPT、Geminiの品質順位を付けることはできません。
確認できたのは、次の事実です。
- Codexによる生成、レビュー、最終確認はこの回では成功した
- Geminiレビューはコマンド長の問題で実行できなかった
- フォールバックにより処理全体は停止しなかった
- Claudeの品質はこのログでは未評価
モデル評価と実行基盤の評価を分けることが、本記事の重要な差別化ポイントです。
Claude・GPT・Geminiを公平に比較する7ステップ
ステップ1:自動化する成果物を一つ決める
最初に「AIを使う」ではなく、繰り返し作る成果物を決めます。
入力:公式情報、商品データ、アクセスデータ
処理:分類、比較、要約、文章化
出力:記事、レポート、商品説明、メール
収益導線:広告、紹介料、商品販売、月額課金
初心者は、公開や送信まで一度に自動化せず、「下書きを作る」工程から始めると安全です。
ステップ2:成功条件を機械判定できる形にする
「良い記事を作る」のような条件では、自動判定できません。
次のように分解します。
- 文字数が3,000〜5,000字
- H2見出しが5個以上ある
- 公式情報へのリンクが3件以上ある
- 指定キーワードがタイトルと導入文に含まれる
- JSONが指定スキーマに一致する
- 禁止表現が含まれていない
- CTAリンクが存在する
- 公開URLがHTTP 200を返す
- 画像URLがHTTP 200を返す
判定できない品質は、人間または別モデルによる採点項目として残します。
ステップ3:評価用データを最低30件用意する
10件程度では、通常時の動作しか見えない場合があります。
次の3種類を各10件用意します。
- 正常データ
- 欠損のあるデータ
- 情報が矛盾しているデータ
実運用で長文を扱うなら、短い入力だけでなく、通常長と上限に近い長文も含めます。
評価用データは途中で変更せず、モデル間で共通にしてください。
ステップ4:同一条件で3モデルを実行する
最初の比較では、次をそろえます。
- 入力データ
- システム指示
- 出力形式
- 利用可能なツール
- タイムアウト
- 最大再試行回数
- 推論設定
- 実行リージョン
各モデル向けにプロンプトを最適化する比較は、第2段階で行います。
まず共通プロンプトで基礎性能を測り、その後にモデル別最適化を行うと、「モデルの差」と「プロンプト調整の差」を分けられます。
ステップ5:出力を100点満点で採点する
採点例は次のとおりです。
| 評価項目 | 配点 |
|---|---|
| 事実との一致 | 30 |
| 指示への準拠 | 20 |
| 出力形式の正しさ | 15 |
| 読みやすさ | 10 |
| 必須情報の網羅 | 10 |
| 処理成功率 | 5 |
| 処理時間 | 5 |
| 原価 | 5 |
重大な事実誤認が1件でもあれば不合格にするなど、合計点とは別に失格条件も設定します。
ステップ6:主担当・検査担当・代替モデルを決める
本番では、1モデルへ全工程を任せるより、役割を分けたほうが障害に強くなります。
低価格モデルで分類・重複除外
↓
均衡型モデルで本文生成
↓
別モデルで事実・形式を検査
↓
失敗時は代替モデルへ切り替え
↓
公開後にURL・画像・CTAを自動確認
たとえば次のように設計できます。
- Gemini:大量データの分類とPDF解析
- Claude:長いルールに基づく本文作成
- GPT:JSON検査、ツール実行、公開確認
これは推奨例であり、固定の正解ではありません。実データの合格率と原価で役割を入れ替えてください。
ステップ7:下書き運用から段階的に無人化する
導入段階を分けます。
- AI出力を保存するだけ
- 自動検査後に人間が確認する
- 低リスク記事だけ自動公開する
- 公開後のリンクと表示を自動確認する
- 異常時だけ人間へ通知する
請求、契約、送金、投資、医療、法務など、誤りによる損失が大きい処理には人間の承認を残します。
AI自動化を本番運用する専門家チェックリスト
モデルIDをログへ保存する
latestのような更新型エイリアスは、提供元の更新で挙動が変わることがあります。
リクエストごとに次を記録します。
model_id
model_snapshot
prompt_version
reasoning_setting
input_tokens
output_tokens
cached_tokens
tool_calls
latency_ms
retry_count
error_type
request_id
利用できる場合は固定モデルIDやスナップショットを使います。
平均ではなくp95を見る
平均応答時間が短くても、一部の処理が長時間停止すれば無人運用には不利です。
確認する指標は次の3つです。
- p50:通常時の処理時間
- p95:遅い側5%付近の処理時間
- 最大値:タイムアウト設計の参考値
タイムアウト後の重複実行を防ぐ
タイムアウトは、「処理が失敗した」ことを必ずしも意味しません。サーバー側では完了しているのに、応答だけ受け取れなかった可能性があります。
対策として、次を保存します。
- リクエストID
- 冪等性キー
- 処理開始・実行中・完了の状態
- 公開済み記事の識別子
- 再試行回数
これにより、同じ記事の二重公開や二重請求を防げます。
HTTP 200だけで成功と判定しない
APIがHTTP 200を返しても、拒否応答、空出力、形式違反が含まれる場合があります。
成功判定には次を含めます。
- 停止理由が正常か
- 必須フィールドが存在するか
- JSONスキーマに一致するか
- 出力が空でないか
- 引用URLが実在するか
- 禁止表現や拒否文がないか
チャット契約とAPI契約を区別する
Claude、ChatGPT、Geminiの月額プランとAPIの従量課金は別です。
チャット画面を契約していても、APIを同じ料金内で無制限に使えるとは限りません。APIキー、請求上限、利用枠を別に確認してください。
よくある失敗と改善方法
失敗1:最高性能モデルを全工程に使う
分類、タグ付け、重複除外まで高価格モデルへ任せると、原価が膨らみます。
改善方法: 低価格モデルで一次処理し、判断が難しいデータだけ上位モデルへ送ります。
失敗2:長文をコマンド引数へ直接渡す
Hiroのログでは、Gemini CLIレビューがThe command line is too long.で停止しました。
改善方法: 標準入力、一時ファイル、API本文のいずれかを使います。長文入力を含む結合テストも追加してください。
失敗3:AI自身に事実確認を完結させる
同じモデルに記事作成と事実確認を任せると、自分の誤りを見逃す場合があります。
改善方法: 公式情報を別工程で取得し、文章ではなく「主張・根拠URL・確認結果」の単位で検査します。
失敗4:タイムアウト後すぐに再実行する
元の処理が裏で続いていると、重複生成や二重公開につながります。
改善方法: 処理状態と冪等性キーを確認してから再試行します。待機時間は指数バックオフで延ばします。
失敗5:生成成功を事業成果と扱う
記事ファイルが作成されても、読まれず、クリックされず、成約しなければ収益資産とはいえません。
改善方法: 公開、インデックス、検索流入、CTAクリック、成約、粗利まで追跡します。
失敗6:完全自動化を永久放置と考える
モデルの廃止、料金改定、認証変更、規約変更は発生します。
改善方法: 毎日の死活監視、月次の品質確認、モデル廃止日の監視を組み込みます。現実的な完全自動化とは、「人間が不要」ではなく「異常時だけ人間が介入する状態」です。
AI自動化で追跡すべきKPI
| KPI | 計算・確認方法 | 初期目標例 |
|---|---|---|
| 無人完了率 | 人手なしの完了件数 ÷ 総実行件数 | 90%以上 |
| 検査合格率 | 自動検査の合格件数 ÷ 生成件数 | 95%以上 |
| 事実誤認率 | 誤った主張数 ÷ 検査した主張数 | 1%未満 |
| 再試行率 | 再試行件数 ÷ 総実行件数 | 5%未満 |
| フォールバック率 | 代替モデルへ切り替えた件数 ÷ 総実行件数 | 継続監視 |
| 1成果物当たり原価 | 総費用 ÷ 合格成果物数 | 採算から逆算 |
| p95処理時間 | 実行時間の95パーセンタイル | タイムアウト未満 |
| 人間介在時間 | 月間の確認・復旧・修正時間 | 前月比で減少 |
| CTAクリック率 | CTAクリック数 ÷ 記事閲覧数 | テーマ別に比較 |
| 成約率 | 成約数 ÷ CTAクリック数 | 商品別に比較 |
| 月間粗利 | 売上-AI・配信・決済・保守費用 | 黒字を維持 |
| 投資回収期間 | 初期構築費 ÷ 月間粗利 | 目標期間内 |
数値目標は例です。誤りによる損失が大きい業務では、速度や原価より事実性を優先します。
API単価を半分にできても、検査合格率が下がり、人間の修正時間が増えれば改善とはいえません。月間粗利と人間介在時間を必ず並べて確認してください。
「複数モデル構成にも欠点がある」という反論
複数モデルを組み合わせれば、必ず安定するわけではありません。
主な欠点は次のとおりです。
- API契約と請求管理が増える
- プロンプト差異への対応が必要になる
- 障害点が増える
- データが複数事業者を通る
- 同じ処理を重複させると原価が上がる
- モデル間で出力形式が微妙に異なる
小規模運用では、1モデルと人間確認のほうが簡単で安い場合があります。
複数モデル化を検討する目安は、次のいずれかに該当するときです。
- 月間実行回数が増え、停止の損失が大きくなった
- 単一モデルの障害が公開停止へ直結する
- 検査工程を独立させる必要がある
- 人間の修正時間が増えている
- 低価格モデルへの振り分けで十分な費用削減が見込める
Claude・GPT・Gemini比較の限界
本記事には次の限界があります。
- 料金と仕様は2026年7月23日時点
- Hiroの実行ログは特定PCでの一例
- 同一プロンプトによる3モデルの品質比較は未実施
- Claudeは紹介した実行ログの生成工程で使われていない
- CLIの失敗率とAPIの失敗率は同じではない
- ベンチマーク結果は実際の業務データを保証しない
- 自動化による収益は保証されない
したがって、本記事の比較表をそのまま採用するのではなく、自分のデータを使って再評価する必要があります。
まとめ:Claude・GPT・Geminiのどれを選ぶべきか
2026年のAI比較では、ブランドの勝敗より、自分の処理に対する合格率、原価、速度、停止率が重要です。
選び方をまとめると次のようになります。
- 長い指示、文章制作、エージェント処理を重視するならClaude Sonnet 5
- 複雑な業務フロー、構造化出力、ツール連携を重視するならGPT-5.6 Terra
- マルチモーダル処理、高頻度バッチ、単価を重視するならGemini 3.6 Flash
- 本番運用では、単一モデル固定よりフォールバックを検討する
- 最終判断はベンチマークではなく、自社データの合格成果物原価で行う
今日から実行できる手順は次のとおりです。
- 自動化したい成果物を一つ選ぶ
- 正常・欠損・矛盾データを各10件用意する
- 成功条件と失格条件を数値化する
- 3モデルへ同じ入力と指示を送る
- 事実性、形式、時間、再試行、原価を記録する
- 主担当、検査担当、代替モデルを決める
- 最初は下書き保存まで自動化する
- 合格率と無人完了率を確認してから公開を接続する
AIは収益を保証する装置ではありません。需要調査、コンテンツ品質、法令、著作権、サービス規約、税務まで含めて事業として設計する必要があります。
本気でAI自動化の仕組みを構築したい方へ
AIを比較するだけでは、収益につながる資産は残りません。
差が生まれるのは、情報収集、生成、自動検査、公開、販売、効果測定を一つの流れとして接続し、失敗時にも止まりにくい仕組みを作れるかどうかです。
用途別の実践マニュアルでは、設計図、作業手順、収益導線、検査項目、失敗時の切り分け方法を確認できます。
まずは、自分の環境で再現できる小さな処理から始めてください。