2026 年 AI 语音转文字模型怎么选:准确率、价格与性价比对比
比较主流 AI 转写模型的每小时 API 费用、准确率与功能限制,找到适合录音、会议和多语言任务的高性价比方案,并估算后续摘要成本。

同样是 100 小时录音,使用 Groq 托管的 Whisper Large V3 Turbo,基础转写费是 4 美元;换成 Mistral 的 Voxtral Mini Transcribe 2,则是 18 美元。但这两笔钱买到的未必是同一种结果:你需要的究竟是可以搜索的文字、标清谁说了什么的会议记录,还是能与录音对齐的字幕?
只需要基础录音转写,我们的预算首选是 Groq 上的 Whisper Large V3 Turbo。 如果会议记录必须包含说话人标签和逐词时间戳,成本优先时先试 Voxtral Mini Transcribe 2;如果更在意减少文字错误,再与 ElevenLabs Scribe v2 对比。下文会列出这些判断所依据的价格和评测。
新发布的 MAI-Transcribe-2 在价格和公开准确率上很有吸引力,但不能直接当作默认生产方案:它的 Azure 接入仍处于公开预览阶段,没有 SLA(服务水平协议),微软也不建议用于生产。这个限制与榜单成绩同样重要。
本文价格与文档核验于 2026 年 9 月 4 日,依据官方 API 资料和独立评测作出编辑判断,并非我们对所有模型完成了一轮实测。比较主要针对已经录好的音频,不混入会议记录软件订阅或实时语音助手费用。
主流转写 API 价格一览
真正应该比较的是具体模型、服务商和处理模式的组合。只问“Whisper 多少钱”还不够:自己部署模型、调用托管 API、购买使用该模型的桌面软件,费用完全不是一回事。
下表是文件转写的公开基础用量价格,不是最终账单。美元均为 USD;不含税、存储、重试、可选功能,也不抵扣免费额度或协议折扣。“约”表示按 token 计费后的估算;Scribe 一行表示基础用量价值,套餐费用与额度另算。
| 模型与服务 | 每小时音频基础费 | 100 小时基础用量费 | 计费前提 |
|---|---|---|---|
| Whisper Large V3 Turbo · Groq | $0.04 | $4 | 每次请求至少按 10 秒计费 |
| MAI-Transcribe-2 · Microsoft | $0.10 | $10 | 限时优惠;Azure 接入为预览版 |
| Soniox · 异步文件 API | 约 $0.10 | 约 $10 | 按音频与文字 token 计费 |
| Whisper Large V3 · Groq | $0.111 | $11.10 | 不是 Turbo 型号 |
| Qwen3 ASR Flash Filetrans · 阿里云 | $0.126 | $12.60 | 新加坡地区,每秒 $0.000035 |
| GPT-4o Mini Transcribe · OpenAI | 约 $0.18 | 约 $18 | 官方估算费率 |
| Voxtral Mini Transcribe 2 · Mistral | $0.18 | $18 | 每分钟 $0.003 |
| Universal-3.5 Pro · AssemblyAI | $0.21 | $21 | 预录音频型号,不是 Streaming |
| Scribe v2 · ElevenLabs | $0.22 | $22 用量价值 | 另查套餐和付费附加项 |
| Nova-3 · Deepgram | $0.258 / $0.312 | $25.80 / $31.20 | 预录音频,单语 / 多语 |
| GPT-Transcribe · OpenAI | $0.27 | $27 | 每分钟 $0.0045 |
| Gemini 3.5 Transcribe · Google | 约 $0.30 | 约 $30 | Developer API;含音频输入与文字输出 |
| GPT-4o Transcribe · OpenAI | 约 $0.36 | 约 $36 | 官方估算费率 |
如果服务地区和目标语言适合,还应检查一个低价选项:StepFun 公布的 StepAudio 2.5 ASR 价格为每小时 0.15 元人民币,100 小时为 15 元。这里保留原币价格,不凭一次美元换算就把它称为全球用户都能使用的最便宜方案。
这是一份有公开价格的代表性短名单,并未穷尽所有语音服务。已有云服务合同、指定部署地区或特殊术语要求,都可能改变你的候选范围。
准确率榜单到底能说明什么
OpenRouter 的转写榜单适合发现正在被使用的模型,但它按请求量排名,不按转写准确率排名。热门模型值得考察,却不代表它一定认得出你的客户姓名。
要比较相同测试条件下的文字质量,可以参考 Artificial Analysis 的非流式 AA-WER v2 榜单。本次核验时的部分结果如下:
| 模型与测试服务商 | 词错误率,越低越好 |
|---|---|
| MAI-Transcribe-2 · Microsoft | 2.0% |
| Scribe v2 · ElevenLabs | 2.2% |
| Gemini 3.5 Transcribe · Google | 2.6% |
| GPT-Transcribe · OpenAI | 3.3% |
| Voxtral Mini Transcribe 2 · Mistral | 3.6% |
| Whisper Large V3 Turbo · Groq | 4.6% |
词错误率(WER)统计转写结果相对参考文本多了、漏了或换错了多少词,并不是“每句话正确的概率”。一个金额写错,或一句话漏掉“不”,可能比几处格式差异严重得多。
这套评测方法使用约 8 小时、三个数据集,权重分别为 50%、25%、25%;其中包括英语议会发言和财报电话会,部分长文件会按照模型限制切分。它不能证明哪个模型的中文、阿拉伯语或所有语言都最好,也没有告诉你说话人标签是否分对了。
榜单适合缩小范围,不能代替你自己的录音样本。引用成绩时还要保留型号和服务商:例如 Universal-3 Pro 的结果,不能换个名字就变成 Universal-3.5 Pro 的成绩。
不同任务,我们会选谁
基础文字转写:预算优先选 Groq Whisper Turbo
如果目标是让录音档案可以搜索,或先得到一份供人修改的文字,100 小时 4 美元的 Groq Whisper Turbo 值得第一个试。推荐它的理由是低廉的托管费用和有文档可查的 API,不是它不会出错。
Groq 文档明确区分了 Turbo 和 Large V3:Turbo 支持多语言转写,但不支持翻译端点;不足 10 秒的请求仍按 10 秒收费。对一小时的访谈影响不大,对被切成大量短片段的音频却可能很明显。
只要你的主要需求是文字,且样本检查过关,它就是合理的省钱选择。如果必须可靠地标出“谁说了什么”,应比较包含说话人处理的完整方案,不能把基础转写单价当成全部成本。
会议记录:Voxtral 看功能成本,Scribe 看文字质量
会议需要说话人标签时,我们会先测试成本较低的 Voxtral Mini Transcribe 2。Mistral 公布了说话人分离、逐词时间戳和 13 种支持语言。说话人分离,也叫 diarization,就是把不同人的发言区分开,便于追溯一句话是谁说的。
但有标签不等于所有声音都被完整记录。Mistral 明确说明,多人同时说话时,模型通常只转写其中一人的内容。经常争相发言的会议,尤其需要检查这一点。
同组中,Scribe v2 更值得文字质量优先的用户测试。按公布的基础用量价格,100 小时只比 Voxtral 多 4 美元,而上面的评测中它的词错误率更低。如果能减少校对,这点差价可能值得。不过,ElevenLabs 的关键词提示和实体检测另收费,还应检查实际套餐,不能只比较每小时 $0.22。文字错误率也不能替你判断哪家分说话人更准。
MAI-Transcribe-2:值得试验,暂不作为默认生产方案
微软在 9 月 3 日的发布说明中公布了每小时 $0.10 的优惠,持续到 2026 年底。结合公开质量成绩,它是很有吸引力的试验对象。
但 Azure Speech 接入文档仍明确标注:公开预览、不提供服务水平协议、不建议用于生产。地区和条款合适时,可以在原型中测试;不要只看优惠价,就用它承担无人值守的正式流程,也不要假定 2027 年仍是同样价格。
OpenAI 与 Google:先比较专门做转写的型号
在 OpenAI 选项里,GPT-Transcribe是本次比较中较新的专用转写模型;GPT-4o Mini Transcribe 则保留了约 $0.18/小时的低价选择。与其因为熟悉“4o”就直接选旧版 GPT-4o Transcribe,不如先比较这两个型号。
Gemini 3.5 Transcribe也是专用转写选项,提供说话人分离和逐词时间戳。Google 给出的约 $0.005/分钟包含音频输入和文字输出,并不只是输入费用。如果已经接入 Google API,它值得一并测试;但不能把它与 Transcribe Live,或接收音频附件的普通 Gemini 聊天模型混为一谈。
Soniox、Qwen、AssemblyAI 和 Deepgram 为什么仍值得比较
Soniox 可以进入低成本候选,但约 $0.10/小时并非固定小时单价。它同时计算音频输入、你提供的文字上下文和文字输出,输出更多内容或增加翻译会改变账单。
中文任务应该把 Qwen 放进实际样本测试,而不是照搬英语榜单。阿里云文件转写价格要按地区和准确型号查看。开放权重的 Qwen3-ASR-1.7B则是另一种部署选择,不是 Flash API 换了个名字。本地运行可以不按调用次数交 API 费用,但仍有硬件和维护成本。
AssemblyAI 当前模型文档列出的预录音频价格是 Universal-3.5 Pro 每小时 $0.21,Universal-2 每小时 $0.15;需要查看具体语言支持,而不是借用旧型号的分数。Deepgram Nova-3的预录音频费用包含说话人分离,多语基础价格则高于单语。两者都值得进入功能相同的会议方案比较,不应只因基础单价不是最低就被排除。
100 小时录音,真正要花多少钱
假设一个月有 100 小时单声道访谈,先转成文字,再做摘要。按上表基础费率,Groq Turbo 是 4 美元,Voxtral 是 18 美元,GPT-Transcribe 是 27 美元。这里是用量演算,不是实测账单。
再假设校对人力价值为每小时 20 美元。Voxtral 比 Groq 多出的 14 美元,只相当于全月 42 分钟的校对时间。如果它在你的流程中节省了更多时间,较高的 API 费用就可能划算。我们没有测出它一定能省这么久;42 分钟只是供你验证的盈亏平衡点。
还有三处计费细节可能改变结果:
- 短请求。 Groq 每次至少计费 10 秒,把录音切得太碎会抬高费用。
- 必需功能。 ElevenLabs 的关键词提示另收每小时 $0.05,100 小时就增加 5 美元用量费,其他费用另计。
- 声道。 Deepgram 按处理的声道计费,10 分钟双声道录音可能按 20 分钟处理量计算。
这些规则分别来自 Groq 文件限制、ElevenLabs API 价格和 Deepgram 计费说明。算账时要使用真正会提交的配置。
实时转写应另算一笔账。例如 AssemblyAI 的流式服务按连接持续时间收费,而不只是上传的音频长度。处理已有文件很快,也不等于实时用户很快就能看到第一个词或最终结果。
别漏算摘要和翻译的模型费用
转写 API 交付的是原始文字。如果还要让大模型整理会议纪要、翻译或提取行动项,就会产生第二笔费用。摘要模型比较进一步说明了如何检查缩短后的纪要是否保留决策和限定条件。
这一步可以使用 AI 小课的大模型价格计算器。例如,假设全月的转写文本加提示共占 150 万输入 token,摘要共占 15 万输出 token,就在两个输入框分别填 1.5 和 0.15,比较不同模型的文字处理费用。这里的 token 数是独立假设,不是说 100 小时音频必然对应这些文字量。
这个工具估算输入、输出 token 成本,不按音频分钟计算转写费。把它给出的文字处理估算,加上转写、必需功能、存储、重试和校对成本,才更接近完整预算。如果长录音要分段摘要,再汇总一次,重复输入的内容也应计入。
留下两个候选,检查最容易出错的部分
基础文字转写可以先用 Groq Turbo 对比一个准确率更高的候选;会议记录可以从 Voxtral 与 Scribe 开始,只有试验允许使用预览服务时才加上 MAI。中文或混语任务则加入适用的 Qwen 服务,不假定英语排名直接成立。
准备几段你有权处理的录音:一段清晰单人发言、一段有噪声或多人同时讲话的对话、一段包含姓名、金额或专业术语的内容。给不同模型相同音频和等效要求,检查漏掉的发言、重要词语、说话人切换、时间戳,以及你实际花了多久修正。不要只看文字读起来是否流畅。
上传私密录音前,还要确认服务商的数据保留、训练使用和地区处理条款。然后选择满足真实要求的最便宜方案:一份只花 4 美元、却要修上好几个小时的转写结果,并不是真正的预算赢家。
参考资料
- OpenRouter 转写榜单:用于发现热门模型,不是准确率评测。
- Artificial Analysis 非流式榜单与评测方法:质量数据及适用范围。
- Groq 转写文档:Whisper 价格、型号区别和最低计费规则。
- Mistral Voxtral 文档与发布说明:价格、会议功能及重叠语音限制。
- ElevenLabs API 价格:Scribe 用量价格和附加项。
- 微软发布条款与 Azure 接入文档:限时优惠和预览限制。
- OpenAI 价格与 Google Developer API 价格:专用转写模型的费率与估算。
- Soniox 价格、阿里云价格与 StepFun 价格:其他计费方式与地区价格。
- AssemblyAI 模型文档与 Deepgram 价格:型号、处理模式和功能费用。
- Qwen3-ASR-1.7B 模型卡:独立的开放权重部署选项。







