Volver a todos los artículos
Artículo

Mejores modelos de traducción con IA en 2026: calidad, términos y coste

Autor:

Compara GPT, Gemini, Claude, DeepSeek, HY-MT2, DeepL y Google Translation. Presupuesta traducción y revisión sin confundir tokens y caracteres.

Un libro abierto con líneas de texto abstractas alineadas en páginas opuestas y una pequeña pestaña en el lomo

«No elimines la copia de seguridad» es una frase breve. Una traducción fluida que pierde el «no» sigue siendo incorrecta. Para textos de producto y documentación, elegir un modelo exige equilibrar significado, terminología, formato y el tiempo que alguien dedicará a corregirlo.

Nuestro especialista económico para probar es HY-MT2-7B mediante el endpoint de Tencent Cloud publicado en OpenRouter, para textos que quepan en su contexto de 8K. GPT-5.6 Luna y DeepSeek V4 Flash son nuestras alternativas generalistas. Para un flujo dedicado, también compararíamos la opción optimizada para calidad de DeepL y Google Cloud Translation, en vez de suponer que un chatbot general siempre es mejor. Este artículo no establece un ganador de precisión para todos los idiomas.

La documentación y los precios se comprobaron el 4 de septiembre de 2026. Es una comparación de fuentes públicas con ejemplos presupuestarios, no un experimento entre modelos. Los ejemplos prácticos se centran en contenido de producto inglés–chino. Quedan fuera la traducción de voz, la interpretación y las suscripciones de aplicaciones.

Empieza por elegir el tipo de servicio

OpciónPor qué incluirlaQué comprobar
GPT-5.6 LunaPrecio por token bajo para una primera pasadaSignificado, marcadores y salida facturada real
DeepSeek V4 FlashModelo general barato y aún más económico en horario valleHorario, configuración de razonamiento y revisión
Gemini 3.8 FlashAlternativa en la API general de GooglePrecio inicial y tokens de toda la ejecución
Claude Sonnet 5Comparación más cara para instrucciones y revisiónSi realmente reduce la edición en tu contenido
HY-MT2-7BEspecialista alojado barato o pesos descargablesLímites del servicio, coste de despliegue y par de idiomas
DeepL optimizado para calidadControles específicos y glosariosIdiomas, plan y comportamiento solicitado
Google Cloud TranslationEndpoints NMT y Translation LLM en una APIEndpoint utilizado y caracteres facturados

Son modelos de entrega distintos. Un modelo descargado no incluye alojamiento gratuito. La API de DeepL no es un checkpoint público. Google Cloud Translation no comparte endpoint ni facturación con Gemini. Conserva esas diferencias al comparar costes.

Cuánto cuesta la traducción facturada por tokens

Las cifras son USD por millón de tokens, con entrada de texto estándar sin caché. La última columna supone 2 millones de tokens de entrada y 2 millones de salida facturados, repartidos en peticiones dentro del nivel citado. Es una suposición independiente, no una conversión desde páginas o caracteres chinos.

ModeloEntrada / 1 MSalida / 1 MCoste de ejemplo
HY-MT2-7B · Tencent Cloud mediante OpenRouter0,074 $0,295 $0,738 $
GPT-5.6 Luna0,20 $1,20 $2,80 $
DeepSeek V4 Flash, punta0,44 $1,32 $3,52 $
Gemini 3.8 Flash0,75 $3,75 $9 $
Claude Sonnet 52 $10 $24 $

Luna usa el nivel de contexto corto. DeepSeek baja a 1,76 dólares si todo cumple el horario valle; sus ventanas punta laborables son 01:00–04:00 y 06:00–10:00 UTC. La tarifa inicial de Gemini termina el 31 de diciembre de 2026 y después duplica el ejemplo a 18 dólares. Se excluyen impuestos, herramientas adicionales, reintentos y revisión humana.

La tabla explica nuestra selección económica; no demuestra calidad. Un modelo que ignore una instrucción terminológica puede borrar todo el ahorro con minutos de corrección. Enviar un manual completo para traducir un botón también puede costar más que enviar el botón con las frases que lo explican.

Un servicio dedicado cambia el cálculo

DeepL: un glosario es una función del flujo, no una garantía

La API de texto de DeepL ofrece opciones orientadas a calidad o latencia, contexto y glosarios. Su parámetro context no se factura, mientras un LLM general suele contar el contexto como entrada. El glosario debe coincidir con el par de idiomas y requiere especificar el idioma fuente.

Esto hace útil a DeepL cuando cadenas breves dependen de información circundante. Comprueba el idioma y la opción exactos: que un control exista para un destino no implica que exista para otro. Usa la tarifa de tu plan de API, no el precio de una suscripción de consumo o de otra región.

Elegiríamos este servicio si un flujo de glosario establecido ahorra integración y revisión. No lo llamaríamos el traductor inglés–chino más preciso sin probar el material real.

Google Cloud Translation: caracteres, no tokens

Los precios de traducción de Google indican 20 dólares por millón de caracteres de entrada para NMT tras la franquicia aplicable. El endpoint estándar Translation LLM cobra 10 dólares por millón de caracteres de entrada y otros 10 por la salida. La traducción adaptativa y los documentos formateados tienen otros precios.

Con un millón hipotético de caracteres de entrada y otro de salida, Translation LLM cuesta 20 dólares. NMT también cuesta 20 antes del crédito aplicable. No equivale a los dos millones de tokens de entrada y salida de la tabla anterior.

Google cuenta puntos de código Unicode, incluidos espacios y caracteres no traducidos. Diez páginas no son una unidad comparable directamente con tokens. Comprueba el endpoint y cuenta el contenido enviado.

HY-MT2: especialista alojado barato o despliegue propio

OpenRouter publica un endpoint de Tencent Cloud con las tarifas anteriores, contexto de 8192 tokens y hasta 4096 de salida. Merece una prueba en trabajos breves y repetidos. Un manual largo debe dividirse con cuidado; glosario y contexto siguen contando. El ejemplo excluye posibles cargos de plataforma y no presupuesta alojamiento propio.

La ficha de HY-MT2-7B ofrece un modelo específico con ejemplos de terminología, estilo y contenido estructurado. Es evaluable cuando importa controlar el despliegue y el equipo puede mantener la inferencia.

Sus comparaciones son pruebas del proveedor, no un veredicto independiente. Incluye cómputo, capacidad ociosa, actualizaciones y revisión. Las variantes menores o cuantizadas necesitan sus propias pruebas.

Cómo decidir si una traducción sirve

Las evaluaciones WMT se organizan por tareas y pares de idiomas. MT Metrics Eval facilita puntuaciones humanas y automáticas, incluidas valoraciones MQM para algunos pares. Ninguna justifica combinar años, idiomas y versiones en una clasificación universal.

Para un equipo de producto, una prueba pequeña suele ser más útil. Considera esta cadena inglesa inventada:

Do not delete the backup until the export is complete. Your trial ends on September 30. Contact {support_email} for help.

Da a cada candidato el mismo glosario y contexto. Una versión china útil debe conservar la prohibición, el orden, la fecha y el marcador exacto. No puede convertir «termina tu prueba» en «se renueva tu suscripción», pues inventaría una facturación.

Comprueba después un párrafo con términos repetidos y un archivo estructurado con claves, enlaces y cadenas visibles. Analiza el resultado, compara marcadores y pide a una persona bilingüe que revise el sentido. Gramática, tipografía y estilo importan, pero no deben ocultar un importe cambiado o una condición ausente.

Registra por separado errores críticos y cambios menores. Oculta nombres cuando sea posible. Un ejemplo atractivo no basta; conserva también resultados fallidos y torpes.

Presupuesta la revisión antes de elegir

Usa la calculadora de precios de AILesson para las opciones por tokens: 2 de entrada y 2 de salida reproducen el volumen supuesto. Haz coincidir el endpoint, no solo el nombre. No estima planes de DeepL, caracteres de Google ni alojamiento de HY-MT2.

Empieza con una muestra y lee el uso real antes de extrapolar. Tokenizadores y direcciones cambian el recuento. Si un segundo modelo revisa, su entrada suele incluir fuente, primera salida e instrucciones; la revisión no es una salida gratuita.

En el ejemplo, Sonnet cuesta 21,20 dólares más que Luna. Con revisión a 30 dólares por hora, 42,4 minutos ahorrados en el lote cubren la diferencia. Es un umbral, no una ventaja medida. El candidato barato es mejor si ambos exigen la misma revisión.

Para borradores breves de bajo riesgo, compara HY-MT2 alojado con un generalista económico. Para textos públicos, compara un servicio dedicado y uno general con el mismo glosario y lista de errores. Mantén aprobación humana para significados importantes. Elige el menor coste total que preserve lo que dice el original, no la salida más pulida.

Referencias