2026 年 AI 翻译模型怎么选:翻译质量、术语一致性与 API 费用
比较 GPT、Gemini、Claude、DeepSeek、HY-MT2、DeepL 和 Google 翻译服务,从中英内容任务出发,算清初译与校对成本。

“不要删除备份”只有几个字。翻译再流畅,漏掉“不要”也算失败。为产品文案和帮助文档选翻译模型,要一起考虑原意、术语、格式,以及最后需要人花多少时间修改。
短文本能放进 8K 上下文时,我们会先试 OpenRouter 上由 Tencent Cloud 提供的 HY-MT2-7B,把它作为专用翻译的预算候选。 通用模型则从 GPT-5.6 Luna 和 DeepSeek V4 Flash 开始。如果需要专门的翻译工作流,再把 DeepL 的质量优先选项和 Google Cloud Translation 放进对照,不预设通用聊天模型一定更好。本文不会把其中任何一个说成所有语言的准确率冠军。
文档与价格核查于 2026 年 9 月 4 日。这是一份基于公开来源、带预算演算的比较,不是多模型翻译实测。具体例子面向中英产品内容,不涵盖语音同传或翻译软件订阅。
先分清要买哪种服务
| 候选 | 为什么值得比较 | 重点检查 |
|---|---|---|
| GPT-5.6 Luna | 初译的表列 token 成本较低 | 原意、占位符与实际计费输出 |
| DeepSeek V4 Flash | 低成本通用模型,非高峰更便宜 | 调用时段、推理设置与校对量 |
| Gemini 3.8 Flash | Google 通用模型 API 中的对照选项 | 限时价格与完整运行用量 |
| Claude Sonnet 5 | 用于检验指令执行与修订是否值得多付费 | 是否真的减少你这类内容的修改 |
| HY-MT2-7B | 低价托管专用模型,也可下载权重 | 托管长度限制、部署成本与目标语对 |
| DeepL quality-optimized | 专门的翻译参数与术语表工作流 | 语言支持、套餐和请求的模型行为 |
| Google Cloud Translation | 翻译 API 下的 NMT 与 Translation LLM | 用的是哪种端点、哪些字符计费 |
这些选项的交付方式不同。下载模型不等于获得免费托管服务,DeepL 的 API 选项不是公开权重文件,Google Cloud Translation 也不是 Gemini 的同一个端点或计费体系。算钱之前,先保留这些区别。
按 token 计费的翻译,费用是多少
下面均为美元、每百万 token 单价,使用标准处理和未缓存文本输入。最后一列假设一批任务累计使用 200 万输入、200 万计费输出 token,各次请求都在相应费率档位内。这个用量不是从固定页数或汉字数换算来的。
| 模型 | 每百万输入 | 每百万输出 | 示例费用 |
|---|---|---|---|
| HY-MT2-7B · OpenRouter 上的 Tencent Cloud | $0.074 | $0.295 | $0.738 |
| GPT-5.6 Luna | $0.20 | $1.20 | $2.80 |
| DeepSeek V4 Flash,高峰 | $0.44 | $1.32 | $3.52 |
| Gemini 3.8 Flash | $0.75 | $3.75 | $9 |
| Claude Sonnet 5 | $2 | $10 | $24 |
Luna 采用短上下文档位。DeepSeek 的全部请求若都符合非高峰计价,示例费用降为 1.76 美元;高峰为周一至周五 UTC 01:00–04:00、06:00–10:00。Gemini 限时价到 2026 年 12 月 31 日结束,按已公布的后续价格,例子变为 18 美元。表中不含税、额外工具、重试和人工校对。
这张表说明了为什么先测便宜候选,却不能证明翻译质量。只要模型不遵守术语要求,几分钟修改就可能花掉全部 API 差价。同样,只翻译一个按钮,却把整本手册都发过去,费用可能比“按钮加几句必要背景”高很多。
专用翻译服务,账要换一种算法
DeepL:术语表是流程优势,不是质量保证
DeepL 文本 API提供质量或延迟取向的模型选项,以及上下文和术语表参数。它的 context 不计费;通用大模型通常会把提供的背景文字计为输入 token。使用术语表时,必须指定源语言,术语表语对也必须与请求一致。
对于依赖产品背景的短文案,这是值得对照的差别。但要确认目标语言和参数是否支持:某种语言能用的控制项,不一定适用于另一种语言。费用使用你所选 API 套餐的报价,不拿消费者订阅或其他地区的价钱代替。
如果成熟的术语表流程能减少接入与审核工作,这类服务可能更合适。没有用实际文档对照过,就不能把它称为中英翻译最准确的选择。
Google Cloud Translation:按字符,不按 token
Google 翻译价格列出的 NMT 费用,是扣除适用月度额度后,每百万输入字符 20 美元;标准 Translation LLM 文本端点则对输入和输出分别收取每百万字符 10 美元。自适应翻译和带格式文档另有价格。
假设有 100 万输入字符、100 万输出字符,Translation LLM 用量费为 20 美元。NMT 在扣减适用额度之前也是 20 美元。但这不是前表中“200 万输入 token 加 200 万输出 token”的同一份工作量。
Google 按 Unicode 码点计字符,提交的空白和未翻译字符也可能计费。“十页文档”不能直接与大模型 token 单价比较。先确认端点,再统计实际提交的内容。
HY-MT2:低价托管和自己部署是两笔账
OpenRouter 列出的 Tencent Cloud 端点采用上表费率,上下文为 8,192 token,最多输出 4,096 token。因此,重复进行的短文本翻译值得试它;长手册则要认真分段,术语表和背景也占用输入。表中例子不含可能适用的平台费用,更不是自托管报价。
腾讯的 HY-MT2-7B 模型卡提供专门面向翻译的模型,以及术语、风格和结构化内容的提示示例。希望自行控制部署、又具备推理服务维护能力的团队,可以把它放进测试。
模型卡中的横向结果属于厂商报告,不是对你文档的独立结论。预算里应包含算力、空闲容量、升级和校对。小型号或量化版本也要单独检查,不能直接继承另一检查点的表现。
什么样的翻译才算可以用
WMT 翻译评测对应具体任务和语对。MT Metrics Eval 工具则提供人工与自动评分,包括部分语对的 MQM 评分。它们都不支持把不同年份、语言和模型版本拼成一个万能排名。
对于产品团队,一小组明确的验收要求,往往比没有依据的总分更有用。下面是一条为说明方法而编写的英文 UI 文案:
Do not delete the backup until the export is complete. Your trial ends on September 30. Contact {support_email} for help.
给候选相同的术语表和产品背景。合格的中文翻译必须保留禁止事项、事件先后、日期和原样占位符。它不能把“试用结束”改成“订阅续费”,因为原文没有提到续费事件。
接着,检查一段重复出现产品术语的正文,再检查含有键名、链接和可见文案的结构化文件。解析输出、比对占位符,并请懂两种语言的人确认原意。语法、标点和风格偏好当然重要,但不能掩盖金额被改或条件被漏掉。
把严重语义错误与小修改分开记录,条件允许时隐藏模型名。不要只保留最漂亮的一条样本;失败和别扭的输出也应该留在审核集合里。
算上修订,再选性价比赢家
在 AI 小课的大模型价格计算器中,输入和输出分别填 2、2,可以按目录中的相应费率比较这些 token 计费选项。要对齐托管端点,不能只看模型名字。工具不会计算 DeepL 套餐费用、Google Translation 字符账单,也不会估算自托管 HY-MT2 的硬件成本。
先拿样本读取实际 token 用量,再推算全量。分词方式和翻译方向都会影响结果。如果加一个模型审核译文,它的输入通常还包括原文、初译和审核要求;复核不是只花一点输出费的免费附赠。
在表中用量下,Sonnet 比 Luna 多花 21.20 美元。若假设校对每小时 30 美元,整批少改 42.4 分钟就能抵消差价。这是盈亏平衡计算,不是实测证明 Sonnet 能省这么久。两者需要同样多校对时,便宜方案仍更划算。
低风险短文本初稿,可以先比较托管 HY-MT2 和一个预算通用模型;对外产品文案,用同一术语表和错误清单,对照专用服务与通用模型。涉及重要含义的内容保留人工确认。最终选的是完整成本最低、又保住原意的方案,而不是单纯读起来最漂亮的译文。
参考资料
- OpenAI 价格、DeepSeek 价格、Gemini 3.8 Flash 指南和 Anthropic 价格:token 费率与条件。
- DeepL 文本翻译 API:上下文、术语表与模型选项。
- Google Cloud Translation 价格:字符计费端点与文档区别。
- HY-MT2-7B 模型卡:专用模型与部署说明。
- OpenRouter 的 HY-MT2-7B 页面:Tencent Cloud 端点报价与长度限制。
- WMT25 翻译任务与 MT Metrics Eval:评测范围及人工评分资源。







