Claude・GPT・Geminiを比較して自動化システムを設計するイメージ

「Claude、GPT、Geminiのうち、結局どれを選べばいいのか」

AIで記事作成やデータ処理を自動化しようとすると、ほぼ必ずこの問題にぶつかります。

しかし、モデル単体のベンチマーク順位だけで選ぶと失敗します。自動運転では文章力だけでなく、API料金、処理時間、形式遵守率、再試行回数、ツール連携、認証エラー、タイムアウトまで含めて採算が決まるからです。

本記事では、2026年7月23日時点の公式情報を基に、次の均衡型モデルを比較します。

  • Claude Sonnet 5
  • GPT-5.6 Terra
  • Gemini 3.6 Flash

さらに、Hiroが運営する本サイトの自動記事生成ログを使い、「どのAIが賢いか」だけでなく「無人実行すると、どこで止まるのか」まで検証します。

結論を先にまとめると、万能な1位はありません。

  • 長い指示やエージェント処理の品質を重視するならClaude
  • 複雑な業務フローと構造化出力をまとめるならGPT
  • マルチモーダル処理や大量バッチを重視するならGemini
  • 本番運用では、主担当・検査担当・障害時の代替モデルを分ける

目標は、AIに作業を一度手伝わせることではありません。記事、比較データ、レポート、商品情報などを継続的に生成し、効果測定まで回る「自動化資産」へ組み込むことです。

Claude・GPT・Geminiの違いを比較する前提

Claude、GPT、Geminiは、いずれも大規模言語モデルを中心としたAIサービスです。

初心者向けに言い換えると、文章を書くチャットボットではなく、次の処理を共通の指示形式で実行できるエンジンです。

  • 情報の分類
  • 長文の要約
  • 記事やメールの作成
  • 画像・PDF・動画の解析
  • JSONなど決められた形式での出力
  • 外部ツールやAPIの呼び出し
  • コードの作成と検証

注意したいのは、「Claude」「GPT」「Gemini」が単一モデルの名前ではない点です。各社には、高性能モデル、均衡型モデル、低価格モデルがあります。

ブランド名だけを比較するのは、自動車メーカー名だけを見て燃費を比べるようなものです。実務では、少なくとも次の条件をそろえて評価します。

  • 正確なモデルID
  • APIの入力・出力単価
  • 推論設定
  • 入力データ
  • プロンプト
  • 利用するツール
  • タイムアウト時間
  • 再試行条件

Claude Sonnet 5・GPT-5.6 Terra・Gemini 3.6 Flash比較表

2026年7月23日時点の公式仕様は次のとおりです。

比較項目Claude Sonnet 5GPT-5.6 TerraGemini 3.6 Flash
提供元AnthropicOpenAIGoogle
モデルIDclaude-sonnet-5gpt-5.6-terragemini-3.6-flash
主な位置付け速度と知能の両立知能とコストの均衡高速なエージェント・マルチモーダル処理
コンテキスト上限100万トークン105万トークン1,048,576トークン
最大出力12.8万トークン12.8万トークン65,536トークン
標準入力単価3ドル/100万トークン2.50ドル/100万トークン1.50ドル/100万トークン
標準出力単価15ドル/100万トークン15ドル/100万トークン7.50ドル/100万トークン
向いている運用長い指示、制作、コーディング複雑な業務フロー、構造化出力高頻度処理、画像・動画・PDF

Claude Sonnet 5には、2026年8月31日まで入力2ドル・出力10ドル/100万トークンの導入価格が設定されています。9月1日以降は入力3ドル・出力15ドルの標準価格になる予定です。また、新しいトークナイザーにより、同じ文章でもClaude Sonnet 4.6よりトークン数が約30%増える場合があります。Claude Sonnet 5公式資料

GPT-5.6 Terraは、105万トークンのコンテキストと12.8万トークンの最大出力に対応します。入力が272Kトークンを超えるリクエストでは、入力単価が2倍、出力単価が1.5倍になり、割増はリクエスト全体に適用されます。GPT-5.6 Terra公式資料

Gemini 3.6 Flashは、テキスト、画像、動画、音声、PDFを入力でき、標準料金は入力1.50ドル、出力7.50ドルです。出力料金には思考トークンも含まれるため、画面に表示された回答だけで原価を見積もらないようにします。Gemini 3.6 Flash公式仕様Gemini API料金

料金や仕様は変更される可能性があります。本番導入時には、公式ページとAPIから取得できる実使用量を再確認してください。

API料金を同じ条件で比較する

次の条件で、1回当たりのテキスト生成費用を計算します。

入力:10,000トークン
出力:2,000トークン
検索、画像生成、キャッシュ、税、為替変動は除外
Claudeは2026年8月31日までの導入価格を使用
Geminiは標準料金を使用

計算式は次のとおりです。

1回当たりの概算原価
= 入力トークン ÷ 1,000,000 × 入力単価
+ 出力トークン ÷ 1,000,000 × 出力単価
モデル入力費用出力費用1回の概算原価月10万回
Claude Sonnet 50.020ドル0.020ドル0.040ドル4,000ドル
GPT-5.6 Terra0.025ドル0.030ドル0.055ドル5,500ドル
Gemini 3.6 Flash0.015ドル0.015ドル0.030ドル3,000ドル

Claudeの標準料金移行後は、同じ条件で1回0.060ドル、月10万回で6,000ドルです。

ただし、この表だけで「Geminiが最も安い」と結論付けることはできません。形式違反や事実誤認による再生成が増えると、表示単価が安いモデルでも最終原価が高くなるからです。

実務では、次の式を使います。

合格成果物1件当たり原価
= API・検索・画像・再試行の総費用
÷ 検査に合格した成果物数

用途別に見るClaude・GPT・Geminiの選び方

Claude:長い指示と自律処理を重視する場合

Claude Sonnet 5は、長い制作ルールを守る文章生成、コーディング、複数ツールをまたぐエージェント処理の候補です。

向いている処理には次があります。

  • 複数の資料を読み、矛盾を抽出する
  • 長い執筆ルールを守って記事を作る
  • リポジトリを調査し、修正とテストを行う
  • ツールの実行結果を確認しながら次の処理を判断する
  • 100万トークン級のコンテキストを扱う

移行時には注意点があります。

Claude Sonnet 5では適応型思考が標準で有効です。また、手動の拡張思考設定や、非デフォルトのtemperaturetop_ptop_kはエラーになる場合があります。

さらに、新しいトークナイザーでは同じ文章のトークン数が従来より増える可能性があります。旧モデルで測った原価表やmax_tokensをそのまま転用せず、実際のプロンプトを再計測してください。

GPT:複雑な業務フローと構造化出力を重視する場合

GPT-5.6 Terraは、データ取得、分析、生成、検査を一つのフローへまとめたい場合の候補です。

向いている処理には次があります。

  • データ取得からレポート作成までの連続実行
  • JSONスキーマに従った商品データ生成
  • コード作成、テスト、修正
  • Web検索やファイル検索を使った調査
  • コンピューター操作を含む業務フロー
  • MCPや関数呼び出しによる外部連携

GPT-5.6 Terraは、noneからmaxまで複数の推論レベルを利用できます。高い推論レベルが常に事業上の最適解とは限りません。

本番データで、少なくとも次の3条件を比較します。

速度重視:reasoning.effort = low
均衡型 :reasoning.effort = medium
難問向け:reasoning.effort = high

品質差が小さいなら、処理時間と原価が低い設定を採用します。

Gemini:画像・動画・PDFと大量処理を重視する場合

Gemini 3.6 Flashは、テキストだけでなく画像、音声、動画、PDFを入力できるマルチモーダルモデルです。

向いている処理には次があります。

  • 商品画像から特徴を抽出する
  • 大量の記事候補を分類する
  • PDFや動画から情報を整理する
  • Google検索で情報を補完する
  • Google Cloud上の処理と接続する
  • 低コストで一次処理を大量実行する

一方、無料枠と有料枠では、レート制限や入力データの扱いが異なります。公式料金ページでは、無料枠のコンテンツはGoogleの製品改善に利用される場合があり、有料枠では利用されないと説明されています。

機密情報を扱う場合は、価格だけでなく、契約プラン、保存条件、リージョン、社内規程を確認してください。

3つのAIを収集・生成・検証へ役割分担する自動化フロー

Hiro運営サイトの一次ログで分かったこと

一般的なAI比較記事は、ベンチマーク表を並べて終わりがちです。

本記事では、本サイトのauto-ai-blogリポジトリに保存された自動記事生成ログを確認しました。比較したのはモデルの知能だけではなく、WindowsとPowerShell上でAI CLIを無人実行したときの停止原因です。

検証環境

2026年7月23日に各CLIで--versionを実行した結果は次のとおりです。

Claude Code:2.1.179
Gemini CLI:0.42.0
Codex CLI:0.144.5
OS:Windows
シェル:PowerShell
ログ:generator/logs/generate.log

2026年7月23日の実行結果

実際のログには次の処理が記録されていました。

06:27:39 Codexでドラフト生成を開始
06:30:15 ドラフト生成に成功
06:30:15 Geminiでレビューを開始
06:30:15 Geminiレビューが失敗
06:30:15 Codexレビューへフォールバック
06:33:36 Codexレビューに成功
06:33:36 Codexで最終確認を開始
06:37:33 最終確認に成功
06:37:33 記事ファイルを保存
06:37:36 Notionへの保存に成功
06:37:39 Git pushに成功

ドラフト開始から記事保存までは約9分55秒、Git pushまでは約10分でした。

これは特定のPC、プロンプト、CLI設定、記事テーマにおける1回の結果です。一般的なモデル速度を示すベンチマークではありません。

停止原因はGeminiの文章力ではなかった

Geminiレビューの失敗理由は次のとおりです。

review: gemini CLI failed: The command line is too long.

長い記事とレビュー指示をWindowsのコマンド引数として渡したため、OSまたはCLIのコマンド長制約に当たったと考えられます。

このログだけを見て、「Geminiは長文レビューが苦手」と判断するのは誤りです。モデルへリクエストが正常に届く前の、実行基盤側の問題だからです。

改善候補は次の3つです。

  1. 長文を標準入力から渡す
  2. UTF-8の一時ファイルへ保存し、ファイル経由で読み込む
  3. CLIを介さず、APIのリクエスト本文として送る

別の実行では、Codex CLIが設定された240秒を超えてタイムアウトした記録もあります。また、Gemini CLIでは認証プランや信頼済みディレクトリ設定に起因するエラーも確認されています。

一方、Claude Codeはこの実行フローの生成・レビュー担当に設定されていませんでした。そのため、このログからClaude、GPT、Geminiの品質順位を付けることはできません。

確認できたのは、次の事実です。

  • Codexによる生成、レビュー、最終確認はこの回では成功した
  • Geminiレビューはコマンド長の問題で実行できなかった
  • フォールバックにより処理全体は停止しなかった
  • Claudeの品質はこのログでは未評価

モデル評価と実行基盤の評価を分けることが、本記事の重要な差別化ポイントです。

Claude・GPT・Geminiを公平に比較する7ステップ

ステップ1:自動化する成果物を一つ決める

最初に「AIを使う」ではなく、繰り返し作る成果物を決めます。

入力:公式情報、商品データ、アクセスデータ
処理:分類、比較、要約、文章化
出力:記事、レポート、商品説明、メール
収益導線:広告、紹介料、商品販売、月額課金

初心者は、公開や送信まで一度に自動化せず、「下書きを作る」工程から始めると安全です。

ステップ2:成功条件を機械判定できる形にする

「良い記事を作る」のような条件では、自動判定できません。

次のように分解します。

  • 文字数が3,000〜5,000字
  • H2見出しが5個以上ある
  • 公式情報へのリンクが3件以上ある
  • 指定キーワードがタイトルと導入文に含まれる
  • JSONが指定スキーマに一致する
  • 禁止表現が含まれていない
  • CTAリンクが存在する
  • 公開URLがHTTP 200を返す
  • 画像URLがHTTP 200を返す

判定できない品質は、人間または別モデルによる採点項目として残します。

ステップ3:評価用データを最低30件用意する

10件程度では、通常時の動作しか見えない場合があります。

次の3種類を各10件用意します。

  • 正常データ
  • 欠損のあるデータ
  • 情報が矛盾しているデータ

実運用で長文を扱うなら、短い入力だけでなく、通常長と上限に近い長文も含めます。

評価用データは途中で変更せず、モデル間で共通にしてください。

ステップ4:同一条件で3モデルを実行する

最初の比較では、次をそろえます。

  • 入力データ
  • システム指示
  • 出力形式
  • 利用可能なツール
  • タイムアウト
  • 最大再試行回数
  • 推論設定
  • 実行リージョン

各モデル向けにプロンプトを最適化する比較は、第2段階で行います。

まず共通プロンプトで基礎性能を測り、その後にモデル別最適化を行うと、「モデルの差」と「プロンプト調整の差」を分けられます。

ステップ5:出力を100点満点で採点する

採点例は次のとおりです。

評価項目配点
事実との一致30
指示への準拠20
出力形式の正しさ15
読みやすさ10
必須情報の網羅10
処理成功率5
処理時間5
原価5

重大な事実誤認が1件でもあれば不合格にするなど、合計点とは別に失格条件も設定します。

ステップ6:主担当・検査担当・代替モデルを決める

本番では、1モデルへ全工程を任せるより、役割を分けたほうが障害に強くなります。

低価格モデルで分類・重複除外
均衡型モデルで本文生成
別モデルで事実・形式を検査
失敗時は代替モデルへ切り替え
公開後にURL・画像・CTAを自動確認

たとえば次のように設計できます。

  • Gemini:大量データの分類とPDF解析
  • Claude:長いルールに基づく本文作成
  • GPT:JSON検査、ツール実行、公開確認

これは推奨例であり、固定の正解ではありません。実データの合格率と原価で役割を入れ替えてください。

ステップ7:下書き運用から段階的に無人化する

導入段階を分けます。

  1. AI出力を保存するだけ
  2. 自動検査後に人間が確認する
  3. 低リスク記事だけ自動公開する
  4. 公開後のリンクと表示を自動確認する
  5. 異常時だけ人間へ通知する

請求、契約、送金、投資、医療、法務など、誤りによる損失が大きい処理には人間の承認を残します。

AI自動化を本番運用する専門家チェックリスト

モデルIDをログへ保存する

latestのような更新型エイリアスは、提供元の更新で挙動が変わることがあります。

リクエストごとに次を記録します。

model_id
model_snapshot
prompt_version
reasoning_setting
input_tokens
output_tokens
cached_tokens
tool_calls
latency_ms
retry_count
error_type
request_id

利用できる場合は固定モデルIDやスナップショットを使います。

平均ではなくp95を見る

平均応答時間が短くても、一部の処理が長時間停止すれば無人運用には不利です。

確認する指標は次の3つです。

  • p50:通常時の処理時間
  • p95:遅い側5%付近の処理時間
  • 最大値:タイムアウト設計の参考値

タイムアウト後の重複実行を防ぐ

タイムアウトは、「処理が失敗した」ことを必ずしも意味しません。サーバー側では完了しているのに、応答だけ受け取れなかった可能性があります。

対策として、次を保存します。

  • リクエストID
  • 冪等性キー
  • 処理開始・実行中・完了の状態
  • 公開済み記事の識別子
  • 再試行回数

これにより、同じ記事の二重公開や二重請求を防げます。

HTTP 200だけで成功と判定しない

APIがHTTP 200を返しても、拒否応答、空出力、形式違反が含まれる場合があります。

成功判定には次を含めます。

  • 停止理由が正常か
  • 必須フィールドが存在するか
  • JSONスキーマに一致するか
  • 出力が空でないか
  • 引用URLが実在するか
  • 禁止表現や拒否文がないか

チャット契約とAPI契約を区別する

Claude、ChatGPT、Geminiの月額プランとAPIの従量課金は別です。

チャット画面を契約していても、APIを同じ料金内で無制限に使えるとは限りません。APIキー、請求上限、利用枠を別に確認してください。

よくある失敗と改善方法

失敗1:最高性能モデルを全工程に使う

分類、タグ付け、重複除外まで高価格モデルへ任せると、原価が膨らみます。

改善方法: 低価格モデルで一次処理し、判断が難しいデータだけ上位モデルへ送ります。

失敗2:長文をコマンド引数へ直接渡す

Hiroのログでは、Gemini CLIレビューがThe command line is too long.で停止しました。

改善方法: 標準入力、一時ファイル、API本文のいずれかを使います。長文入力を含む結合テストも追加してください。

失敗3:AI自身に事実確認を完結させる

同じモデルに記事作成と事実確認を任せると、自分の誤りを見逃す場合があります。

改善方法: 公式情報を別工程で取得し、文章ではなく「主張・根拠URL・確認結果」の単位で検査します。

失敗4:タイムアウト後すぐに再実行する

元の処理が裏で続いていると、重複生成や二重公開につながります。

改善方法: 処理状態と冪等性キーを確認してから再試行します。待機時間は指数バックオフで延ばします。

失敗5:生成成功を事業成果と扱う

記事ファイルが作成されても、読まれず、クリックされず、成約しなければ収益資産とはいえません。

改善方法: 公開、インデックス、検索流入、CTAクリック、成約、粗利まで追跡します。

失敗6:完全自動化を永久放置と考える

モデルの廃止、料金改定、認証変更、規約変更は発生します。

改善方法: 毎日の死活監視、月次の品質確認、モデル廃止日の監視を組み込みます。現実的な完全自動化とは、「人間が不要」ではなく「異常時だけ人間が介入する状態」です。

AI自動化で追跡すべきKPI

KPI計算・確認方法初期目標例
無人完了率人手なしの完了件数 ÷ 総実行件数90%以上
検査合格率自動検査の合格件数 ÷ 生成件数95%以上
事実誤認率誤った主張数 ÷ 検査した主張数1%未満
再試行率再試行件数 ÷ 総実行件数5%未満
フォールバック率代替モデルへ切り替えた件数 ÷ 総実行件数継続監視
1成果物当たり原価総費用 ÷ 合格成果物数採算から逆算
p95処理時間実行時間の95パーセンタイルタイムアウト未満
人間介在時間月間の確認・復旧・修正時間前月比で減少
CTAクリック率CTAクリック数 ÷ 記事閲覧数テーマ別に比較
成約率成約数 ÷ CTAクリック数商品別に比較
月間粗利売上-AI・配信・決済・保守費用黒字を維持
投資回収期間初期構築費 ÷ 月間粗利目標期間内

数値目標は例です。誤りによる損失が大きい業務では、速度や原価より事実性を優先します。

API単価を半分にできても、検査合格率が下がり、人間の修正時間が増えれば改善とはいえません。月間粗利と人間介在時間を必ず並べて確認してください。

「複数モデル構成にも欠点がある」という反論

複数モデルを組み合わせれば、必ず安定するわけではありません。

主な欠点は次のとおりです。

  • API契約と請求管理が増える
  • プロンプト差異への対応が必要になる
  • 障害点が増える
  • データが複数事業者を通る
  • 同じ処理を重複させると原価が上がる
  • モデル間で出力形式が微妙に異なる

小規模運用では、1モデルと人間確認のほうが簡単で安い場合があります。

複数モデル化を検討する目安は、次のいずれかに該当するときです。

  • 月間実行回数が増え、停止の損失が大きくなった
  • 単一モデルの障害が公開停止へ直結する
  • 検査工程を独立させる必要がある
  • 人間の修正時間が増えている
  • 低価格モデルへの振り分けで十分な費用削減が見込める

Claude・GPT・Gemini比較の限界

本記事には次の限界があります。

  • 料金と仕様は2026年7月23日時点
  • Hiroの実行ログは特定PCでの一例
  • 同一プロンプトによる3モデルの品質比較は未実施
  • Claudeは紹介した実行ログの生成工程で使われていない
  • CLIの失敗率とAPIの失敗率は同じではない
  • ベンチマーク結果は実際の業務データを保証しない
  • 自動化による収益は保証されない

したがって、本記事の比較表をそのまま採用するのではなく、自分のデータを使って再評価する必要があります。

まとめ:Claude・GPT・Geminiのどれを選ぶべきか

2026年のAI比較では、ブランドの勝敗より、自分の処理に対する合格率、原価、速度、停止率が重要です。

選び方をまとめると次のようになります。

  • 長い指示、文章制作、エージェント処理を重視するならClaude Sonnet 5
  • 複雑な業務フロー、構造化出力、ツール連携を重視するならGPT-5.6 Terra
  • マルチモーダル処理、高頻度バッチ、単価を重視するならGemini 3.6 Flash
  • 本番運用では、単一モデル固定よりフォールバックを検討する
  • 最終判断はベンチマークではなく、自社データの合格成果物原価で行う

今日から実行できる手順は次のとおりです。

  1. 自動化したい成果物を一つ選ぶ
  2. 正常・欠損・矛盾データを各10件用意する
  3. 成功条件と失格条件を数値化する
  4. 3モデルへ同じ入力と指示を送る
  5. 事実性、形式、時間、再試行、原価を記録する
  6. 主担当、検査担当、代替モデルを決める
  7. 最初は下書き保存まで自動化する
  8. 合格率と無人完了率を確認してから公開を接続する

AIは収益を保証する装置ではありません。需要調査、コンテンツ品質、法令、著作権、サービス規約、税務まで含めて事業として設計する必要があります。

本気でAI自動化の仕組みを構築したい方へ

AIを比較するだけでは、収益につながる資産は残りません。

差が生まれるのは、情報収集、生成、自動検査、公開、販売、効果測定を一つの流れとして接続し、失敗時にも止まりにくい仕組みを作れるかどうかです。

用途別の実践マニュアルでは、設計図、作業手順、収益導線、検査項目、失敗時の切り分け方法を確認できます。

まずは、自分の環境で再現できる小さな処理から始めてください。

本気で自動化・不労所得を構築したい方向けの実践マニュアルを見る