すべての記事へ戻る
記事

2026年のAI文字起こしモデル比較:精度、料金、価値

著者:

音声文字起こしモデルを時間単価、精度、実用上の制限で比較。録音、会議、多言語工程に適した候補を探します。

波形表示、現れ始めた文字起こしテープ、小さな値札を備えた小型録音機

録音100時間の文字起こしは、追加費用前でGroqのWhisper Large V3 Turboなら$4、MistralのVoxtral Mini Transcribe 2なら$18です。安い請求は魅力的ですが、検索可能な文章、話者ラベル付き会議メモ、録音と同期する字幕など、必要な成果によって良い購入かどうかが決まります。

基本的な録音音声にはGroqのWhisper Large V3 Turboを低価格候補にします。 話者ラベルと単語単位のタイムスタンプが必要な会議では、Voxtral Mini Transcribe 2を費用優先の候補とし、最安基本料金より誤り削減が重要ならElevenLabs Scribe v2も比べます。価格と判断根拠は以下で説明します。

MAI-Transcribe-2は価格と公開精度が魅力的な新顔ですが、本番の既定候補にはしません。Azure連携はSLAのないパブリックプレビューで、Microsoftは本番利用を推奨していません。この制限はベンチマーク点数と同じくらい重要です。

価格とドキュメントは2026年9月4日に確認しました。公開API文書と独立ベンチマークによる編集上の比較で、全モデルを独自試験したという主張ではありません。完了済み録音が対象で、会議アプリのサブスクリプションやライブ音声エージェントは含みません。

文字起こしAPI料金一覧

比較単位は、特定の提供元が特定モードで提供するモデルです。「Whisperの料金」だけでは不十分です。オープンウェイト、ホスト型API、そのウェイトを使うデスクトップアプリでは費用が違います。

以下はファイル文字起こしの公開基本従量料金で、保証された請求額ではありません。米ドルで、税、ストレージ、再試行、任意機能、無料クレジット、個別割引は除きます。「概算」はトークン課金の見積もりです。Scribeの行はプラン料金やクレジット前の使用価値を示します。

モデルとサービス音声1時間の基本費100時間の基本使用額重要な条件
Whisper Large V3 Turbo · Groq$0.04$41リクエスト最低10秒課金
MAI-Transcribe-2 · Microsoft$0.10$10キャンペーン、Azure連携はプレビュー
Soniox · 非同期ファイルAPI約$0.10約$10音声・文章トークン課金
Whisper Large V3 · Groq$0.111$11.10Turboとは別モデル
Qwen3 ASR Flash Filetrans · Alibaba Cloud$0.126$12.60Singapore料金:$0.000035/秒
GPT-4o Mini Transcribe · OpenAI約$0.18約$18公式推定料金
Voxtral Mini Transcribe 2 · Mistral$0.18$18$0.003/分
Universal-3.5 Pro · AssemblyAI$0.21$21録音済みモデル、Streamingではない
Scribe v2 · ElevenLabs$0.22使用価値$22プランと有料追加機能を確認
Nova-3 · Deepgram$0.258 / $0.312$25.80 / $31.20録音済み単言語/多言語
GPT-Transcribe · OpenAI$0.27$27$0.0045/分
Gemini 3.5 Transcribe · Google約$0.30約$30Developer API、音声入力と文章出力
GPT-4o Transcribe · OpenAI約$0.36約$36公式推定料金

地域と言語が合えば、さらに安い候補があります。StepFunはStepAudio 2.5 ASRを1時間CNY 0.15、100時間CNY 15としています。換算価格で世界的な最安候補だと装わず、元通貨を保ちます。

これは公開料金のある代表候補で、市場の全音声サービスではありません。既存クラウド契約、必要な展開地域、専門用語によって別の候補一覧が妥当になる場合があります。

精度ランキングが実際に測るもの

OpenRouterの文字起こしランキングは利用されているモデル探しに役立ちますが、順位はリクエスト量で、文字起こし精度ではありません。人気モデルは調査候補になりますが、顧客名を正しく認識する証拠ではありません。

条件を合わせた品質指標として、以下はArtificial Analysis公開の非ストリーミングAA-WER v2表のスナップショットです。

モデルと試験提供元単語誤り率。低いほど良い
MAI-Transcribe-2 · Microsoft2.0%
Scribe v2 · ElevenLabs2.2%
Gemini 3.5 Transcribe · Google2.6%
GPT-Transcribe · OpenAI3.3%
Voxtral Mini Transcribe 2 · Mistral3.6%
Whisper Large V3 Turbo · Groq4.6%

単語誤り率は参照文字起こしに対する置換、削除、挿入を数えます。特定の一文が正しい確率ではありません。誤った金額や欠けた「ない」は、害のない書式差より重大かもしれません。

ベンチマーク手法は三つのデータセット約8時間を50%、25%、25%で重みづけします。英語の議会演説と決算説明会を含み、モデル上限に合わせ一部の長いファイルを分割します。この結果は中国語、アラビア語、全言語の勝者を確立せず、話者ラベルの正しさも測りません。

候補を絞るために使い、自分の音声標本を省かないでください。点数にはモデル版と提供元を付けます。たとえばUniversal-3 Proの結果をUniversal-3.5 Proへ付け替えてはいけません。

選ぶモデル

GroqのWhisper Turbo:基本文字起こしの低価格候補

100時間$4なので、検索可能な録音アーカイブや初回文字起こしで最初に評価します。魅力は低いホスト料金と文書化されたAPIであり、誤りが無視できるという約束ではありません。

GroqのドキュメントはTurboとLarge V3を分けます。Turboは多言語文字起こしに対応しますが、翻訳エンドポイントには対応しません。10秒未満のリクエストも10秒分課金されます。インタビューでは小さな差でも、音声を大量の短片へ分ける工程では重要です。

安価な文章が主な成果で、標本がレビューを通る場合に選びます。「誰が何を言ったか」が必要なら、基本文字起こし料金を完成工程の価格とせず、話者ラベルを含む仕組み全体を比較します。

Voxtral対Scribe:会議機能か、文章誤りの少なさか

話者ラベル付き会議ではVoxtral Mini Transcribe 2を費用優先候補にします。Mistralは話者ダイアライゼーション、単語タイムスタンプ、13言語対応を記載しています。ダイアライゼーションとは、発言を正しい人に結びつけるため話者を分けることです。

重要な制限として、Mistralは重複発話では通常一人分だけを文字起こしすると述べています。話者ラベルがあっても、同時発話をすべて捕捉できるとは限りません。

Scribe v2は精度重視の代替です。100時間の基本使用額は$4高いだけで、上のスナップショットではWERが低いため、編集時間が重要なら直接試す価値があります。ElevenLabsはキーワードプロンプトとエンティティ検出を別課金します。$0.22/時間だけでなく実際のプランと機能を比べます。ベンチマークだけで、どちらが会議の話者を正しく付けるかは決まりません。

MAI-Transcribe-2:有力なプレビューだが本番既定ではない

Microsoftの9月3日の公開発表は2026年末まで$0.10/時間を提示しています。品質スナップショットと合わせ、実験上魅力的な価格・精度候補です。

しかしAzure Speechドキュメントは、SLAのないパブリックプレビューで本番ワークロード非推奨と明記します。必要地域と条件が合えば試作品で評価します。キャンペーン価格だけで無人の本番工程を構築したり、2027年も同じ料金と考えたりしません。

OpenAIとGoogle:専用文字起こしモデルを比べる

OpenAIでは、GPT-Transcribeが比較対象の新しい専用候補です。GPT-4o Mini Transcribeは推定$0.18/時間の安価な代替です。「4o」がなじみ深いという理由で古いGPT-4o Transcribeを最適と考えず、まずこの二つを比べます。

Gemini 3.5 Transcribeも専用候補で、話者分離と単語タイムスタンプがあります。Googleの約$0.005/分という見積もりは音声入力と文章出力を合わせたもので、入力費だけではありません。Google API利用者には比較価値がありますが、Transcribe Liveや音声添付を受ける一般Geminiチャットとは別製品です。

Soniox、Qwen、AssemblyAI、Deepgramを残す理由

Sonioxは低価格比較に値しますが、約$0.10/時間は概算です。課金には音声入力、提供した文章コンテキスト、文章出力が含まれ、出力増加や翻訳で請求は変わります。

中国語工程では、英語ベンチマークを流用せずQwenを標本に含めます。Alibaba Cloudのファイル文字起こし料金は地域と正確なモデルに依存します。オープンウェイトのQwen3-ASR-1.7Bは別の展開候補で、Flash APIの別名ではありません。ローカルホストなら呼び出し単価はなくても、ハードウェア・保守費は残ります。

AssemblyAIの現行モデル文書は録音済み音声についてUniversal-3.5 Proを$0.21/時間、Universal-2を$0.15/時間としています。古いベンチマーク点数を借りず、言語対応と正確な版を確認します。DeepgramのNova-3料金は録音済み音声で話者分離を含み、多言語基本料金は単言語より高くなります。最安基本料金で勝たなくても、機能をそろえた会議比較には両方が含まれます。

100時間に本当にかかる費用

架空の月間処理として、単一チャネルのインタビュー100時間を考えます。最初の成果は文章で、要約は後です。掲載料金では追加費用前でGroq Turbo $4、Voxtral $18、GPT-Transcribe $27です。使用量計算で、実請求ではありません。

レビュアー時間を$20/時間とします。GroqよりVoxtralが高い$14は、月全体で42分のレビュー時間に相当します。工程でそれ以上短縮できれば高いAPI料金を回収できます。短縮は測定しておらず、42分が試すべき損益分岐点です。

三つの課金詳細で比較が変わります。

  • 短いリクエスト: Groqの最低10秒により、細かく分割した音声の費用が上がります。
  • 必須機能: ElevenLabsのキーワードプロンプトは追加$0.05/時間です。100時間ではほかの料金前に$5加わります。
  • チャネル: Deepgramは処理チャネルごとに課金し、10分の2チャネル録音を20分として数える場合があります。

関連情報源はGroqのファイル上限ElevenLabs API料金Deepgramの課金説明です。実際に送る構成を使います。

ライブ文字起こしは別の比較が必要です。たとえばAssemblyAIのストリーミング課金は、アップロード音声だけでなく接続時間を数えます。既存ファイルを高速処理できても、ライブ視聴者へ最初や最後の言葉が届く速さは分かりません。

要約と翻訳の費用を加える

文字起こしAPIは元文章を作ります。その後LLMで会議メモ、翻訳、作業項目抽出を行えば別料金です。要約モデル比較は、短縮メモが決定と条件を保つ確認方法を説明します。

この文章処理にはAILessonのLLM料金計算ツールを使います。月間の文字起こしとプロンプトが入力150万トークン、要約が出力15万トークンと仮定し、該当欄へ1.50.15を入れます。架空の量で、音声100時間からの固定換算ではありません。

計算ツールは入出力トークン費を見積もり、音声分単価の計算はしません。文章処理見積もりに、文字起こし、必須機能、ストレージ、再試行、レビュー時間を加えます。長い文字起こしを分割し最終要約をもう一度実行するなら、繰り返す入力も含めます。

二つの候補で難しい箇所を確認する

基本文字起こしはGroq Turboと高精度候補一つから始めます。会議ではVoxtralとScribeを比べ、プレビューを許容できる実験だけMAIを加えます。中国語や混在言語では、英語の順位を当てはめず該当Qwenサービスを含めます。

処理権限のある録音を使い、きれいな標本、雑音または重複発話、名前・金額・専門用語を含むものを用意します。全モデルに同じ音声と同等の指示を与えます。読みやすさだけでなく、欠落発話、重要語、話者交代、タイムスタンプ、修正時間を確認してください。

私的な録音を送る前に、提供元の保持、訓練利用、地域処理の条件を確認します。そのうえで実際の要件を通る最安候補を選びます。修正に何時間もかかる$4の文字起こしは、低価格の勝者ではありません。

参考資料