すべての記事へ戻る
記事

2026年のAIコーディングモデル比較:API料金と完了タスクあたりの費用

著者:

GPT、Claude、Gemini、DeepSeek、QwenのコーディングモデルをAPI費用、評価根拠、作業との相性で比較。モデルとツールを混同せず低価格候補を選びます。

キーボード部分に交換可能なプロセッサーを備えた小型ノートPC

数セントでパッチを書くモデルでも、修復に1時間かかれば高くつきます。コーディングで役立つ比較は、100万トークンあたりの価格だけではありません。適切なテストを通り、レビューできる変更を得るまでの費用です。

範囲が明確でテストできる変更では、GPT-5.6 Lunaを最初の低価格候補にします。 DeepSeek V4 Flashは、特にピーク外に実行できる仕事の第2候補です。より難しい比較にはClaude Sonnet 5またはGPT-5.6 Terraを加え、安い基準モデルと比べます。これは編集上の出発点であり、全モデルを同じリポジトリで実行した結果でも、普遍的なコーディング王者の主張でもありません。

価格とドキュメントは2026年9月4日に確認しました。ここで比べるのはモデルAPIで、エディターのサブスクリプションではありません。ファイルを開き、コマンドを実行し、プロジェクトをデプロイするアプリを選ぶなら、Vibe Codingツール比較から始めてください。モデルと、その周囲のツールは別の購入対象です。

一つの予算でコーディングAPI料金を比べる

以下は、多数のリクエストを合わせて入力1,000万、課金対象の出力200万トークンと仮定します。1,000万トークンの単一プロンプトではなく、架空の月間処理量です。料金は米ドル、標準処理、キャッシュなし入力で、税、ツール、ストレージ、割引を除きます。各リクエストは掲載料金帯に収める必要があります。

モデルと直接提供サービス入力/1Mトークン出力/1Mトークン利用費の例
GPT-5.6 Luna · OpenAI$0.20$1.20$4.40
DeepSeek V4 Flash · DeepSeekピーク$0.44ピーク$1.32ピーク$7.04
Gemini 3.8 Flash · Google$0.75$3.75$15
Qwen3-Coder-Plus · Alibaba Cloud、Singapore$1$5$20
Claude Sonnet 5 · Anthropic$2$10$40
GPT-5.6 Terra · OpenAI$2$12$44
GPT-5.6 Sol · OpenAI$4$20$80
Claude Opus 5 · Anthropic$5$25$100

OpenAIの行は公開済みの短いコンテキスト料金です。長いコンテキストのリクエストは高くなります。QwenはSingapore地域、入力32Kトークン以下の料金です。32K超128K以下では入力$1.80、出力$9になり、同じ総量が$20ではなく$36になります。

DeepSeekのオフピーク料金はピークの半額で、すべて対象なら例は**$3.52**です。ピークは月曜から金曜の01:00〜04:00と06:00〜10:00(UTC)です。Geminiの掲載料金は2026年12月31日までで、告知済みの1月料金では例が倍の$30になります。これらの条件は無視できる脚注ではなく、価格の一部です。

これは全モデル一覧ではなく候補リストです。地域での提供状況や既存の提供元契約によって、品質試験の前に候補から外れるものもあります。

コーディング順位表で分かること、分からないこと

SWE-benchは、システムがリポジトリの問題を解決できるか測ります。既定のVerified、Bash Only表示はmini-SWE-agentを使うため、無関係な提供元発表を寄せ集めた表より周囲のエージェント条件がそろっています。

それでもモデル、推論設定、エージェント版、実行日を確認してください。2026年2月17日、mini-SWE-agent 2.0.0の履歴例では、高推論のClaude Opus 4.5が76.8%、高推論のGemini 3 FlashとMiniMax M2.5がそれぞれ75.8%を解決しました。これは当時の版の結果で、Opus 5、Gemini 3.8 Flash、新しいMiniMaxの点数ではありません。

ここから言える範囲は、低価格帯のモデルも高価格帯と一緒に試す価値があるということです。9月時点の順位は確立できません。そのため、前世代の結果で空欄を埋めず、現在の価格表と過去の品質根拠を分けています。

リポジトリ修復ベンチマークだけでは、モバイル画面が実用的か、社内フレームワークを知っているか、文書化されていない業務規則を保てるかは分かりません。テストが要件を見落とすこともあります。緑のテスト結果は多くのタスクで必要な根拠ですが、変更の正しい動作を決める代わりにはなりません。

自分の仕事に合う候補を選ぶ

小さな修正とテスト生成:安い候補から

再現できる失敗を直す単一ファイル変更なら、LunaとDeepSeek V4 Flashから始めます。基本料金が低く、誤りを安く検出できる仕事に向く候補です。各呼び出しが安そうだからと無制限に実行させず、試行上限を小さく定めます。

失敗を再現し、必要最小限の編集を行い、関連チェックを実行するよう依頼します。無関係なファイルを繰り返し変える、または失敗テストを説明できないなら候補を切り替えます。多くのコードを書いても、より進んだとは限りません。

DeepSeekのV4リリース文書は、設定可能な推論と現在のAPI対応を説明しています。エージェント工程で評価する理由にはなりますが、既存連携が全ツール呼び出しを正しく扱える証拠ではありません。

複数ファイル:最高価格モデルの前に中価格帯を比べる

複数ファイルをまたぐ作業や、調査が多い仕事では、Sonnet 5とTerraを比較候補にします。あらゆる仕事の既定にする前に、失敗試行やレビュー時間が減る証拠を求める支出方針です。

Anthropicの料金文書によると、Sonnet 5の$2/$10は現在の標準料金で、予定されていた9月の値上げは中止されました。同ページは世代間でトークナイザーが異なることも述べています。同じコードベースでもトークン数は変わるため、固定トークン表は予算の補助であって同一作業の実験ではありません。

Gemini 3.8 Flashも候補です。Googleは一般提供され、長時間のソフトウェア作業を対象とし、掲載トークン単価も低いと説明しています。一方、モデルガイドは、複雑な作業でより多くのトークンを消費しうると警告しています。自動的に安いタスクと数えず、実行全体を測る理由になります。

大きなコンテキストや既存基盤:実際のエンドポイントを確認

Qwen3-Coder-PlusはAlibaba Cloudをすでに使うチームの実用候補ですが、段階料金があるためリポジトリ全体を無差別に送るのは予算上よくありません。提供元、地域、リクエスト長をモデル名と一緒に記録します。

SolとOpus 5は、高額で未解決の仕事に対する第2候補です。高価だから自動的に勝者にはなりません。管理した比較で追加費用に見合うと分かったときに使います。API料金表からその結果は予測できません。

オープンウェイトにも選択肢はありますが、ローカル推論にはハードウェア、稼働率、保守の費用があります。オープンウェイトモデルのベンチマークは、ホスト提供元の量子化版が同じ挙動をする証拠でもありません。実際に展開したものを記録してください。

料金表を実際の運用予算に変える

AILessonのモデル料金計算ツールへ入力10、出力2を入れ、架空の処理量をカタログと比べます。提供元と処理モードを公式料金に合わせます。カタログのエンドポイントが異なる、または新料金が未反映なら、提供元の現行条件を優先します。

次に、代表的な実行の使用量で仮定を置き換えます。繰り返したプロンプト、ツールが返したコード、課金対象の推論出力、再試行を含めてください。提供元の規則に従ってキャッシュヒットを別に数えます。キャッシュ読み取り単価は作成費ではなく、バッチ割引は対話型コーディングで使えるとは限りません。

より重要な計算があります。固定トークン例では、SonnetはLunaより$35.60高くなります。レビュー費を時給$40と仮定すると、差額は月間で53.4分のレビュー時間です。高価なモデルがそれ以上短縮すれば、良い購入かもしれません。その短縮は測定しておらず、試験すべき損益分岐点を示しています。

次の比較可能な変更10件で、API総額、完了変更数、再試行、レビュー分数を記録します。失敗試行も分子に含め、支出を承認済み変更数で割ります。権限、ツール、合格基準は同等にします。最良の価値を持つモデルは、最安トークンで最長パッチを書くものではなく、要件を安定して通過する最も安いモデルです。

参考資料