Mejores modelos de texto a voz en 2026: calidad y coste de API
Compara ElevenLabs, Chirp 3 HD, GPT-4o Mini TTS y las API de voz de Gemini. Separa precios por caracteres y tokens de audio, y presupuesta correcciones.

Una voz agradable que lee un precio incorrecto no es una locución terminada. Si conviertes guiones aprobados en narraciones de producto, audios formativos o anuncios, la pregunta útil es qué modelo de voz reproduce las palabras requeridas con menos correcciones.
Para una narración sencilla, compararíamos Chirp 3 HD con Eleven Multilingual v2. Para respuestas interactivas más rápidas, añade Eleven Flash v2.5; para una interpretación expresiva, considera Eleven v3. GPT-4o Mini TTS es otro candidato con facturación por tokens, y Gemini 3.1 Flash TTS Preview encaja en una evaluación donde se acepte su disponibilidad preliminar. Son puntos de partida basados en las capacidades y la facturación documentadas, no ganadores de una prueba de escucha.
La documentación y los precios se comprobaron el 7 de septiembre de 2026. Esta comparación abarca modelos y API alojados de texto a voz. Excluye la transcripción, las plataformas completas de agentes de voz, las suscripciones de consumo y los costes de producir voces personalizadas. La portada editorial no demuestra el resultado de ningún modelo.
Las API de voz usan unidades de precio distintas
Las filas basadas en caracteres suponen 100 000 caracteres de entrada facturables, antes de franquicias gratuitas, suscripciones, promociones, impuestos y reintentos. No asignamos un precio ficticio equivalente por carácter a las filas basadas en tokens.
| Modelo y servicio directo | Tarifa de uso publicada | Coste por 100 000 caracteres |
|---|---|---|
| Chirp 3 HD · Google Cloud | 30 $ / 1 M de caracteres | 3 $ antes de la franquicia |
| Eleven Flash / Turbo · ElevenAPI | 0,05 $ / 1000 caracteres | 5 $ |
| Eleven Multilingual v2 / Eleven v3 · ElevenAPI | 0,10 $ / 1000 caracteres | 10 $ |
| GPT-4o Mini TTS · OpenAI | 0,60 $ / 1 M de tokens de texto de entrada; 12 $ / 1 M de tokens de audio de salida | Mide los tokens |
| Gemini 3.1 Flash TTS Preview · Gemini API | 1 $ / 1 M de tokens de texto de entrada; 20 $ / 1 M de tokens de audio de salida | Mide los tokens |
Google publica una franquicia mensual aplicable a Chirp 3 HD; la cifra de 3 $ aísla la tarifa de pago, no predice la factura de una cuenta pequeña. La página actual de ElevenAPI especifica la facturación en dólares. No sustituyas estos valores por los créditos de otro producto de ElevenLabs ni des por hecho que una promoción de suscripción anunciada se aplica a todas las cuentas.
Un carácter, un token de texto y un token de audio son unidades distintas. El mismo guion puede generar audios de diferente duración al cambiar la voz, las pausas o la velocidad. Para voz facturada por tokens, mide una generación representativa y usa el consumo registrado. Las tarifas anteriores no determinan qué opción resultará más barata para esa grabación.
Elige un candidato para la parte difícil del guion
La guía de modelos de ElevenLabs presenta Multilingual v2 para voz larga y uniforme, v3 para expresividad y Flash v2.5 para baja latencia. Esto justifica probarlos en trabajos distintos, pero no demuestra cómo pronunciarán tu terminología. La guía también señala las limitaciones de Flash v2.5 al normalizar números.
Para una demostración de producto, empezaríamos con Chirp 3 HD y Multilingual v2 utilizando el mismo guion aprobado. Escucha si faltan palabras, cambia la pronunciación, hay uniones extrañas entre frases o el ritmo dificulta seguir un paso. Si ambos cumplen esos requisitos, resulta razonable elegir el flujo completo más barato.
Para una respuesta conversacional, compara Flash v2.5 con tu endpoint TTS actual bajo las mismas condiciones de red. Mide por separado el tiempo hasta que comienza a oírse la voz y el tiempo hasta que termina. La cifra de latencia de un proveedor no es el retraso total de tu aplicación, que también incluye preparar la respuesta y transportar el audio.
Para una introducción dramática, v3 es candidato porque la expresividad forma parte de su propósito documentado. Mantén fijas las palabras mientras cambias la interpretación. Si una toma añade una exclamación no aprobada o cambia el sentido de una salvedad, falla aunque resulte atractiva.
GPT-4o Mini TTS puede sumarse a cualquiera de estas pruebas con guiones breves cuando sus límites de entrada y salida se ajusten al trabajo. La opción preliminar de Gemini merece la misma prueba de escucha y una revisión expresa de su disponibilidad actual antes de asumir un compromiso de producción. No hace falta cambiar un flujo que funciona solo para añadir el nombre de un modelo nuevo.
Una frase de prueba puede revelar un error costoso
Considera este anuncio inventado:
El taller empieza el 18 de septiembre a las 9:30. La cuota es de 19 dólares y 50 centavos. No entre en la sala B catorce; use la sala B cuarenta.
Escribe la forma oral aceptable antes de generar el audio. Deben conservarse la fecha, la hora, el importe, la negación y los dos números de sala. Para una versión china, aprueba primero el guion chino y revisa su pronunciación por separado. Una buena voz en inglés no demuestra una buena interpretación en chino.
Este ejemplo desarrolla los números potencialmente ambiguos. En tu propia entrada, compara esa forma aprobada con la fuente abreviada, como un código de sala. Preparar el texto puede resolver el problema por menos dinero que repetir generaciones. Sin embargo, escribir un precio con palabras no debe cambiarlo.
Tras la comprobación breve, prueba un guion más largo de la misma tarea. Un modelo puede resolver una frase y perder uniformidad entre párrafos. Mantén los mismos límites de párrafo al comparar candidatos y prueba después por separado cualquier división en fragmentos para producción. Unir archivos de audio introduce otro punto donde pueden fallar las pausas o la continuidad de la voz.
No evalúes únicamente pasando la grabación por una transcripción. Esta puede ayudar a detectar omisiones, pero no juzga por completo el ritmo, el énfasis o las uniones molestas. Debe escucharla alguien que comprenda el idioma de destino.
Presupuesta la grabación que apruebes
Supongamos que un lote hipotético requiere 100 000 caracteres de narración. Con las tarifas por caracteres de la tabla, generarlo todo una vez cuesta 3, 5 o 10 dólares antes de franquicias. Si las correcciones de pronunciación obligan a regenerar otros 20 000 caracteres, los totales pasan a 3,60, 6 o 12 dólares. Es un cálculo bajo un volumen de corrección supuesto, no una tasa de fallos medida de estos modelos.
El mayor coste puede estar en escuchar y editar. Registra los caracteres o tokens generados, los minutos de audio aprobados, los segmentos rechazados y el tiempo de revisión. Divide el coste completo entre los minutos aprobados. Una locución más lenta no debería parecer más eficiente solo porque produzca más minutos con el mismo guion.
Si tu fuente empieza como grabación, elige un modelo de transcripción antes de redactar la narración. Si el guion necesita otro idioma, consulta la comparación de traducción para ese paso. La calidad de la traducción y la de la voz requieren aprobaciones separadas: una traducción errónea perfectamente pronunciada sigue siendo errónea.
Empieza con dos voces en las frases difíciles y después prueba un guion representativo completo. Elige el candidato que conserve las palabras, cumpla los requisitos de interpretación y deje la factura total más baja entre generación y corrección.
Referencias
- Precios de Text-to-Speech de Google Cloud: tarifas por caracteres y franquicias.
- Precios de ElevenAPI: tarifas actuales de uso de API en dólares.
- Modelos de ElevenLabs: objetivos de los modelos y consideraciones sobre normalización de números.
- GPT-4o Mini TTS: tarifas por tokens y límites de entrada.
- Precios de la API de Gemini: tarifas de texto y audio del modelo de voz preliminar.







