返回全部文章
文章

2026 年 AI 语音合成模型怎么选:音色、读音与 API 成本

作者:

比较 ElevenLabs、Chirp 3 HD、GPT-4o Mini TTS 和 Gemini 配音 API,分清字符与音频 token 计费,并把读音修正和重做纳入预算。

一个小扬声器,顶部插着带抽象文字线的脚本纸

声音悦耳,却把价格读错,这段配音仍然不能用。为产品讲解、培训或通知选择语音合成模型,首先要看它能否准确读出已经批准的脚本,以及后面还要花多少时间修正。

普通旁白,我们会先比较 Chirp 3 HD 与 Eleven Multilingual v2。 需要快速响应时加入 Eleven Flash v2.5;需要更明显的情绪表达时考虑 Eleven v3。GPT-4o Mini TTS 是按 token 计费的另一项候选;能够接受预览状态的项目,也可以评估 Gemini 3.1 Flash TTS Preview。这些建议根据文档和计费方式提出,不是试听实测的冠军名单。

文档与价格核查于 2026 年 9 月 7 日。本文比较托管语音合成模型与 API,不包含转写、完整语音 Agent、消费者订阅或定制声音制作费。封面是主题插画,不作为模型输出证据。

先分清字符、文字 token 和音频 token

下表的字符计费项,统一假设输入 10 万个计费字符,暂不扣免费额度,也不套用订阅、促销、税费或重试。按 token 收费的模型不强行换算成字符单价。

模型与直接服务官方用量费率10 万字符的费用
Chirp 3 HD · Google Cloud每百万字符 $30扣额度前 $3
Eleven Flash / Turbo · ElevenAPI每千字符 $0.05$5
Eleven Multilingual v2 / Eleven v3 · ElevenAPI每千字符 $0.10$10
GPT-4o Mini TTS · OpenAI每百万文字输入 token $0.60;音频输出 token $12需测量 token
Gemini 3.1 Flash TTS Preview · Gemini API每百万文字输入 token $1;音频输出 token $20需测量 token

Chirp 3 HD 有适用的月度免费额度,所以表中的 3 美元只是按付费单价计算,不是小用量账户一定会收到的账单。ElevenAPI 当前页面明确按美元计费,不应拿 ElevenLabs 其他产品的积分说明替代,也不能默认每个账户都能享受广告中的订阅优惠。

字符、文字 token、音频 token 是三种单位。同一份脚本更换声音、停顿和语速后,音频长度可能不同。对按 token 收费的服务,应先生成有代表性的片段,读取实际用量,再估算整批任务。仅凭上表,不能判断哪家生成这段录音更便宜。

用脚本中最难的部分挑模型

ElevenLabs 模型指南把 Multilingual v2 定位于稳定的长篇语音,把 v3 用于表达,把 Flash v2.5 用于低延迟任务。这些定位可以解释入选理由,却不能证明它们会正确读出你的行业词。指南还单独说明了 Flash v2.5 的数字规范化限制,也就是把数字和缩写转换为合适读法时需要注意的问题。

产品操作讲解可以先让 Chirp 3 HD 与 Multilingual v2 读同一份脚本。检查漏词、同一个词前后读法不一致、句子衔接突兀,以及语速是否影响听众跟上操作。两者都满足要求时,完整流程更便宜的一项就值得采用。

做对话回复,则把 Flash v2.5 与现有语音接口放在相同网络条件下比较。分别记录多久开始听到声音、多久播放完成。厂商公布的模型延迟,不等于应用从收到问题到出声的总耗时;生成回答和传输音频也需要时间。

需要情绪更鲜明的开场时,可以把 v3 加入候选。比较时先固定文字,只调整表达方式。如果配音擅自增加感叹词,或把原本有条件的说法读成了确定承诺,即使听起来有感染力,也应判为不合格。

GPT-4o Mini TTS 可以参加这些短脚本试验,前提是输入长度和输出满足任务需要。Gemini 的预览型号同样要试听,并在正式接入前核对当前可用状态。已有流程符合要求时,不必只为了更新型号名称而迁移。

一句通知,就能检查几种高代价错误

下面是一段专门设计的虚构通知:

工作坊于 9 月 18 日上午 9 点 30 分开始,费用是 19 美元 50 美分。不要进入 B 十四号房间,请使用 B 四十号房间。

生成前,先确定可以接受的读法。日期、时间、金额、否定词和两个房间号都不能变。对应英文脚本也应单独批准、单独试听;英文表现好,不能直接证明中文读音也好。

例子把容易混淆的数字写得比较明确。处理自己的脚本时,可以把这种形式与原始缩写或房间代码对照试读。先整理输入,可能比反复生成便宜,但把金额改成文字时,金额本身必须保持不变。

短句通过后,还要试听一份同类长脚本。一句话读对了,不代表跨段落也稳定。比较模型时先保持相同分段,再另测正式使用的切段方式;拼接音频也可能引入异常停顿或声音不连贯。

不要仅靠另一个转写模型判分。转写可以帮助找漏词,却难以完整评价重音、节奏和拼接感。最终仍需要懂目标语言的人听一遍。

预算应算到配音通过审核为止

假设一批旁白有 10 万字符,按表中三档字符费率,生成一次分别花 3、5 或 10 美元,未扣免费额度。如果修正读音又生成了 2 万字符,用量费用就变成 3.60、6 或 12 美元。这里的返工量是假设,不是这些模型的实测失败率。

试听和剪辑可能比生成更贵。记录生成字符或 token、通过审核的音频分钟数、废弃片段和审核时间,再计算每分钟合格音频的完整成本。同一段文字故意读慢、产出更多分钟,不应该因此显得更划算。

如果原材料是录音,先参考语音转写模型比较;如果脚本还需要另一种语言,再看翻译模型比较。翻译和发音要分别批准:把错误的译文念得再准确,也不是合格配音。

先用两个候选读困难句,再试听一份完整代表脚本。最终选择能够保留文字、符合表达要求,并让生成与修正总费用最低的方案。

参考资料