すべての記事へ戻る
記事

2026年の低価格LLM比較:API料金と成功タスクあたりの費用

著者:

三つの処理量でGLM、Qwen、GPT、DeepSeek、GeminiのAPI費用を比較。キャンペーン、再試行、レビューを見出しのトークン単価と分けます。

コイン投入口が一体化した小型台座にはめ込まれたモデルチップ

料金表で最も安いモデルは、問い合わせ分類には十分でも、それ以外では高くつくかもしれません。特に3回に1回の応答を直す必要がある場合です。役立つ低価格候補は、確認できる仕事から選び、完了までの費用全体を測ります。

安価な文章処理では、GLM-5.3-FlashとQwen3.8-FlashをGPT-5.6 Lunaと比較します。 DeepSeek V4 Flashも候補で、特にオフピーク時間を使える仕事に向きます。安い候補が要件を満たさないときは、価格帯の高いGemini 3.8 Flashと比べます。これはホスト型APIから選んだ候補一覧であり、世界最安のエンドポイントや測定済みの品質勝者を示すものではありません。

料金は2026年9月5日に確認しました。処理量の例は架空です。一般消費者向けサブスクリプション、無料で無制限という主張、セルフホスト用ハードウェア、マルチモーダル生成は対象外です。

通常価格とキャンペーンを並べる

以下はすべて、100万トークンあたりの米ドル料金、標準処理、キャッシュなしの入力です。各提供元は自社の方法でトークンを数えます。同じトークン数は予算用の仮定で、同じ仕事量の証拠ではありません。

モデルとエンドポイント入力/1M出力/1M条件
GLM-5.3-Flash · Z.AIキャンペーン$0.075、通常$0.15キャンペーン$0.25、通常$0.50現在の50%割引は9月9日24:00(UTC+8)終了
Qwen3.8-Flash · Alibaba Cloud$0.15$0.47Singapore、International、入力最大1Mトークン
GPT-5.6 Luna · OpenAI$0.20$1.20短いコンテキスト料金
DeepSeek V4 Flash · DeepSeekピーク$0.44、オフピーク$0.22ピーク$1.32、オフピーク$0.66時間帯別料金
Gemini 3.8 Flash · Gemini API$0.75$3.752026年12月31日までの導入料金

継続する仕事では、GLMの一時割引だけでなく通常価格も使います。キャンペーンはUTC+8で9月9日から10日に変わる時点で終了します。残り4日の割引を基に1年分の予算を作ってはいけません。

DeepSeekのピーク時間は月曜から金曜の**01:00〜04:00と06:00〜10:00(UTC)**で、それ以外はオフピークです。Geminiは2027年1月1日から入力$1.50、出力$7.50と記載しています。Lunaは入力が272Kトークンを超えるとリクエスト全体の料金が上がります。Qwenは見積もりに地域も含めます。別の展開地域の料金は別の比較です。

どの行にもツール呼び出し、税、失敗した試行、人による確認は含みません。ルーター経由のモデルは料金や構成が異なる場合があるため、記録には実際のエンドポイントを残します。

三つの処理量では、費用の内訳が変わる

関連する長さの上限を下回るリクエストに分けた、架空の月間処理量を考えます。

  • 問い合わせ分類: 入力5M、課金対象の出力0.1Mトークン。処理の大半は読み取りで、回答は短いラベルです。
  • 報告書要約: 入力10M、課金対象の出力0.5Mトークン。結果は元資料より短くても、重要な条件を保つ必要があります。
  • 原稿生成: 入力2M、課金対象の出力2Mトークン。文章生成が請求のより大きな部分を占めます。

GLMの通常価格とDeepSeekのピーク料金を基準にすると、次のようになります。

候補問い合わせ分類要約原稿
GLM-5.3-Flash、通常$0.80$1.75$1.30
Qwen3.8-Flash、Singapore$0.797$1.735$1.24
GPT-5.6 Luna$1.12$2.60$2.80
DeepSeek V4 Flash、ピーク$2.332$5.06$3.52
Gemini 3.8 Flash、導入料金$4.125$9.375$9

これはリンク先の料金からの計算で、品質点ではありません。現在のGLMキャンペーンは同社の行を半額にし、対象となるDeepSeekのオフピーク利用も半額です。告知済みの導入期間後、Geminiの行は倍になります。最安候補との差が小さい処理もあるため、必要な修正量が異なる出力を、わずかな価格差だけで選んではいけません。

課金対象の出力には、利用者に表示される言葉だけでなく、該当する推論トークンも含まれます。一語の分類でも、見えている回答から想像するより高くなる場合があります。予測を広げる前に使用量を測ってください。

安価な既定モデルには明確な失敗条件が必要

問い合わせ分類では、ラベルと、二つのラベルが当てはまる場合の扱いを定めます。人が確認した標本と比べ、件数の少ない分類も別に調べます。ほぼすべてを「一般」にするモデルは、偏った一括処理では高精度に見えても、重要な例を落とすかもしれません。

要約では短い文章の好みではなく、事実を保つ確認方法を使います。レコードには抽出の確認方法、つまり正しい形式、正しい値、欠落情報の誠実な扱いを適用します。「回答が弱そう」より具体的な切り替え条件になります。

長い処理を始める前に第2候補を決めます。基準モデルの応答が決定的な確認に失敗したら、焦点を絞ったフィードバックで再試行するか、未解決のレコードを第2モデルへ送ります。正しさを自動確認できないなら、自信を示す表現が全失敗を見つけると考えず、標本を抽出してレビューしてください。

振り分けの仕組みにも費用があります。正しい処理を高価なモデルへ送ったり、誤った回答を見逃したりするかもしれません。これらも測ります。安価なモデルと高価格モデルを組み合わせただけで、全体を評価せずに高価格モデルの品質を保てるとは主張できません。

高価な呼び出しのほうが安くなる場合

架空のモデルAは1回の完了試行が$0.001で合格率50%、モデルBは$0.0015で合格率90%とします。合格率が安定すると仮定すると、合格タスクあたりの期待生成費は、Aが**$0.002**、Bが約**$0.00167**です。これは掲載モデルの実測比較ではありません。

一括処理をより完全に測る式は次のとおりです。

合格タスクあたりの費用 =
  (再試行を含むAPI利用費 + ツール費 + レビュー費)
  / 合格確認を通ったタスク数

途中で断念したタスクの支出も分子に含めます。一つも合格しなければ、その工程は完了タスクあたりの有効な費用を確立していません。API応答を業務上の成功として数え、失敗を隠してはいけません。

キャッシュやバッチ処理で適切な請求を減らせる場合がありますが、提供元の実際の規則に従います。キャッシュ読み取り単価は、キャッシュの作成・保持費用ではありません。遅延するバッチ処理は、同期応答と同じではありません。本番のトラフィック特性が不明な間は、キャッシュなしの標準料金から始めます。

AILessonの料金計算ツールで、提供元と処理モードを合わせて入出力比率を比較します。次に、小さな代表的試行の実測量へ置き換えます。10件の試験なら明らかな失敗や想定外のトークン使用は分かっても、正確な本番成功率は確立できません。何千件もの既定モデルを決める前に標本を増やしてください。

新しい工程では、Qwen3.8-FlashまたはGLM-5.3-Flashを、Lunaと比較して始めます。要件を満たし、完了までの費用が最も小さいものを残してください。高い料金を払うのは、未解決タスクまたはレビューが減る証拠がある場合であり、次のモデルがより高性能と宣伝されているからではありません。

参考資料