返回全部文章
文章

2026 年 AI 翻译模型怎么选:翻译质量、术语一致性与 API 费用

作者:

比较 GPT、Gemini、Claude、DeepSeek、HY-MT2、DeepL 和 Google 翻译服务,从中英内容任务出发,算清初译与校对成本。

一本打开的书,左右页的抽象文字线条相互对齐,书脊带着小标签

“不要删除备份”只有几个字。翻译再流畅,漏掉“不要”也算失败。为产品文案和帮助文档选翻译模型,要一起考虑原意、术语、格式,以及最后需要人花多少时间修改。

短文本能放进 8K 上下文时,我们会先试 OpenRouter 上由 Tencent Cloud 提供的 HY-MT2-7B,把它作为专用翻译的预算候选。 通用模型则从 GPT-5.6 Luna 和 DeepSeek V4 Flash 开始。如果需要专门的翻译工作流,再把 DeepL 的质量优先选项和 Google Cloud Translation 放进对照,不预设通用聊天模型一定更好。本文不会把其中任何一个说成所有语言的准确率冠军。

文档与价格核查于 2026 年 9 月 4 日。这是一份基于公开来源、带预算演算的比较,不是多模型翻译实测。具体例子面向中英产品内容,不涵盖语音同传或翻译软件订阅。

先分清要买哪种服务

候选为什么值得比较重点检查
GPT-5.6 Luna初译的表列 token 成本较低原意、占位符与实际计费输出
DeepSeek V4 Flash低成本通用模型,非高峰更便宜调用时段、推理设置与校对量
Gemini 3.8 FlashGoogle 通用模型 API 中的对照选项限时价格与完整运行用量
Claude Sonnet 5用于检验指令执行与修订是否值得多付费是否真的减少你这类内容的修改
HY-MT2-7B低价托管专用模型,也可下载权重托管长度限制、部署成本与目标语对
DeepL quality-optimized专门的翻译参数与术语表工作流语言支持、套餐和请求的模型行为
Google Cloud Translation翻译 API 下的 NMT 与 Translation LLM用的是哪种端点、哪些字符计费

这些选项的交付方式不同。下载模型不等于获得免费托管服务,DeepL 的 API 选项不是公开权重文件,Google Cloud Translation 也不是 Gemini 的同一个端点或计费体系。算钱之前,先保留这些区别。

按 token 计费的翻译,费用是多少

下面均为美元、每百万 token 单价,使用标准处理和未缓存文本输入。最后一列假设一批任务累计使用 200 万输入、200 万计费输出 token,各次请求都在相应费率档位内。这个用量不是从固定页数或汉字数换算来的。

模型每百万输入每百万输出示例费用
HY-MT2-7B · OpenRouter 上的 Tencent Cloud$0.074$0.295$0.738
GPT-5.6 Luna$0.20$1.20$2.80
DeepSeek V4 Flash,高峰$0.44$1.32$3.52
Gemini 3.8 Flash$0.75$3.75$9
Claude Sonnet 5$2$10$24

Luna 采用短上下文档位。DeepSeek 的全部请求若都符合非高峰计价,示例费用降为 1.76 美元;高峰为周一至周五 UTC 01:00–04:00、06:00–10:00。Gemini 限时价到 2026 年 12 月 31 日结束,按已公布的后续价格,例子变为 18 美元。表中不含税、额外工具、重试和人工校对。

这张表说明了为什么先测便宜候选,却不能证明翻译质量。只要模型不遵守术语要求,几分钟修改就可能花掉全部 API 差价。同样,只翻译一个按钮,却把整本手册都发过去,费用可能比“按钮加几句必要背景”高很多。

专用翻译服务,账要换一种算法

DeepL:术语表是流程优势,不是质量保证

DeepL 文本 API提供质量或延迟取向的模型选项,以及上下文和术语表参数。它的 context 不计费;通用大模型通常会把提供的背景文字计为输入 token。使用术语表时,必须指定源语言,术语表语对也必须与请求一致。

对于依赖产品背景的短文案,这是值得对照的差别。但要确认目标语言和参数是否支持:某种语言能用的控制项,不一定适用于另一种语言。费用使用你所选 API 套餐的报价,不拿消费者订阅或其他地区的价钱代替。

如果成熟的术语表流程能减少接入与审核工作,这类服务可能更合适。没有用实际文档对照过,就不能把它称为中英翻译最准确的选择。

Google Cloud Translation:按字符,不按 token

Google 翻译价格列出的 NMT 费用,是扣除适用月度额度后,每百万输入字符 20 美元;标准 Translation LLM 文本端点则对输入和输出分别收取每百万字符 10 美元。自适应翻译和带格式文档另有价格。

假设有 100 万输入字符、100 万输出字符,Translation LLM 用量费为 20 美元。NMT 在扣减适用额度之前也是 20 美元。但这不是前表中“200 万输入 token 加 200 万输出 token”的同一份工作量。

Google 按 Unicode 码点计字符,提交的空白和未翻译字符也可能计费。“十页文档”不能直接与大模型 token 单价比较。先确认端点,再统计实际提交的内容。

HY-MT2:低价托管和自己部署是两笔账

OpenRouter 列出的 Tencent Cloud 端点采用上表费率,上下文为 8,192 token,最多输出 4,096 token。因此,重复进行的短文本翻译值得试它;长手册则要认真分段,术语表和背景也占用输入。表中例子不含可能适用的平台费用,更不是自托管报价。

腾讯的 HY-MT2-7B 模型卡提供专门面向翻译的模型,以及术语、风格和结构化内容的提示示例。希望自行控制部署、又具备推理服务维护能力的团队,可以把它放进测试。

模型卡中的横向结果属于厂商报告,不是对你文档的独立结论。预算里应包含算力、空闲容量、升级和校对。小型号或量化版本也要单独检查,不能直接继承另一检查点的表现。

什么样的翻译才算可以用

WMT 翻译评测对应具体任务和语对。MT Metrics Eval 工具则提供人工与自动评分,包括部分语对的 MQM 评分。它们都不支持把不同年份、语言和模型版本拼成一个万能排名。

对于产品团队,一小组明确的验收要求,往往比没有依据的总分更有用。下面是一条为说明方法而编写的英文 UI 文案:

Do not delete the backup until the export is complete. Your trial ends on September 30. Contact {support_email} for help.

给候选相同的术语表和产品背景。合格的中文翻译必须保留禁止事项、事件先后、日期和原样占位符。它不能把“试用结束”改成“订阅续费”,因为原文没有提到续费事件。

接着,检查一段重复出现产品术语的正文,再检查含有键名、链接和可见文案的结构化文件。解析输出、比对占位符,并请懂两种语言的人确认原意。语法、标点和风格偏好当然重要,但不能掩盖金额被改或条件被漏掉。

把严重语义错误与小修改分开记录,条件允许时隐藏模型名。不要只保留最漂亮的一条样本;失败和别扭的输出也应该留在审核集合里。

算上修订,再选性价比赢家

在 AI 小课的大模型价格计算器中,输入和输出分别填 22,可以按目录中的相应费率比较这些 token 计费选项。要对齐托管端点,不能只看模型名字。工具不会计算 DeepL 套餐费用、Google Translation 字符账单,也不会估算自托管 HY-MT2 的硬件成本。

先拿样本读取实际 token 用量,再推算全量。分词方式和翻译方向都会影响结果。如果加一个模型审核译文,它的输入通常还包括原文、初译和审核要求;复核不是只花一点输出费的免费附赠。

在表中用量下,Sonnet 比 Luna 多花 21.20 美元。若假设校对每小时 30 美元,整批少改 42.4 分钟就能抵消差价。这是盈亏平衡计算,不是实测证明 Sonnet 能省这么久。两者需要同样多校对时,便宜方案仍更划算。

低风险短文本初稿,可以先比较托管 HY-MT2 和一个预算通用模型;对外产品文案,用同一术语表和错误清单,对照专用服务与通用模型。涉及重要含义的内容保留人工确认。最终选的是完整成本最低、又保住原意的方案,而不是单纯读起来最漂亮的译文。

参考资料