Mejores modelos de transcripción con IA en 2026: precisión, precio y valor
Compara voz a texto por coste horario de API, precisión y límites prácticos. Elige valor para grabaciones, reuniones o un flujo multilingüe.

Cien horas de grabaciones pueden costar 4 dólares con Whisper Large V3 Turbo de Groq o 18 con Voxtral Mini Transcribe 2 de Mistral, antes de extras. La factura barata atrae. Que sea la mejor compra depende de lo que necesites: palabras buscables, notas con hablantes o subtítulos sincronizados.
Nuestra opción económica para audio grabado básico es Whisper Large V3 Turbo en Groq. Para reuniones con etiquetas de hablante y marcas por palabra, Voxtral Mini Transcribe 2 encabeza nuestra selección por coste, y ElevenLabs Scribe v2 merece comparación si reducir errores importa más que la tarifa base. A continuación se explican precios y pruebas.
MAI-Transcribe-2 destaca por precio y precisión publicada, pero no es nuestra opción de producción: su integración de Azure sigue en vista preliminar pública, sin SLA, y Microsoft desaconseja usarla en producción. Esa restricción importa tanto como su puntuación.
Los precios y documentos se comprobaron el 4 de septiembre de 2026. Es una comparación editorial de API públicas y pruebas independientes, no una afirmación de haber probado todos los modelos. Se centra en grabaciones terminadas, no suscripciones de reuniones ni agentes de voz en directo.
Precios de API de un vistazo
La unidad es un modelo servido por un proveedor concreto en un modo concreto. «Precio de Whisper» no basta. Pesos abiertos, API alojada y aplicación de escritorio tienen costes distintos.
Estas son tarifas base publicadas para archivos, no facturas garantizadas. Importes en USD. Excluimos impuestos, almacenamiento, reintentos, funciones opcionales, créditos y descuentos. «Aprox.» indica una estimación por tokens; Scribe muestra valor de uso antes de cargos o créditos del plan.
| Modelo y servicio | Coste base por hora | 100 horas | Condición importante |
|---|---|---|---|
| Whisper Large V3 Turbo · Groq | 0,04 $ | 4 $ | Mínimo facturado de 10 segundos por petición |
| MAI-Transcribe-2 · Microsoft | 0,10 $ | 10 $ | Promocional; integración Azure preliminar |
| Soniox · API asíncrona | Aprox. 0,10 $ | Aprox. 10 $ | Facturación por tokens de audio y texto |
| Whisper Large V3 · Groq | 0,111 $ | 11,10 $ | Modelo distinto de Turbo |
| Qwen3 ASR Flash Filetrans · Alibaba Cloud | 0,126 $ | 12,60 $ | Singapur: 0,000035 $/segundo |
| GPT-4o Mini Transcribe · OpenAI | Aprox. 0,18 $ | Aprox. 18 $ | Tarifa oficial estimada |
| Voxtral Mini Transcribe 2 · Mistral | 0,18 $ | 18 $ | 0,003 $/minuto |
| Universal-3.5 Pro · AssemblyAI | 0,21 $ | 21 $ | Pregrabado, no Streaming |
| Scribe v2 · ElevenLabs | 0,22 $ | 22 $ de uso | Comprueba plan y complementos |
| Nova-3 · Deepgram | 0,258 $ / 0,312 $ | 25,80 $ / 31,20 $ | Pregrabado monolingüe / multilingüe |
| GPT-Transcribe · OpenAI | 0,27 $ | 27 $ | 0,0045 $/minuto |
| Gemini 3.5 Transcribe · Google | Aprox. 0,30 $ | Aprox. 30 $ | API Developer; audio de entrada y texto de salida |
| GPT-4o Transcribe · OpenAI | Aprox. 0,36 $ | Aprox. 36 $ | Tarifa oficial estimada |
Otro rival barato si encaja con región e idioma: StepFun publica StepAudio 2.5 ASR a 0,15 CNY por hora, o 15 CNY por 100 horas. Conservamos la moneda en vez de fingir que una conversión demuestra una opción globalmente más barata.
Es una selección representativa, no todos los servicios. Un contrato de nube, región obligatoria o vocabulario especializado pueden justificar otra.
Qué miden realmente las clasificaciones
Las clasificaciones de OpenRouter ayudan a descubrir modelos por volumen de peticiones, no por precisión. La popularidad invita a investigar, no demuestra que reconozca nombres de clientes.
Esta instantánea comparable procede de la tabla AA-WER v2 sin streaming de Artificial Analysis:
| Modelo y proveedor probado | Tasa de error; menor es mejor |
|---|---|
| MAI-Transcribe-2 · Microsoft | 2,0 % |
| Scribe v2 · ElevenLabs | 2,2 % |
| Gemini 3.5 Transcribe · Google | 2,6 % |
| GPT-Transcribe · OpenAI | 3,3 % |
| Voxtral Mini Transcribe 2 · Mistral | 3,6 % |
| Whisper Large V3 Turbo · Groq | 4,6 % |
La tasa cuenta sustituciones, eliminaciones e inserciones frente a una referencia. No es la probabilidad de que una frase sea correcta. Un importe equivocado o un «no» ausente puede importar más que diferencias de formato.
La metodología usa unas ocho horas de tres conjuntos ponderados 50 %, 25 % y 25 %. Incluye discurso parlamentario y resultados empresariales en inglés; algunos archivos se fragmentan. No establece un ganador chino, árabe o universal ni mide las etiquetas de hablantes.
Úsala para reducir candidatos, no para omitir tus audios. Conserva versión y proveedor; un resultado de Universal-3 Pro no debe atribuirse a Universal-3.5 Pro.
¿Qué modelo elegiríamos?
Whisper Turbo en Groq: opción económica para texto básico
A 4 dólares por 100 horas, es nuestra primera prueba para un archivo buscable o primera transcripción. Su atractivo es el precio alojado y una API documentada, no errores insignificantes.
La documentación de Groq separa Turbo de Large V3: Turbo transcribe varios idiomas, pero no usa el endpoint de traducción. Peticiones menores de 10 segundos facturan 10. Es poco en entrevistas, mucho si divides en clips diminutos.
Elígelo si el texto barato es el resultado principal y tu muestra pasa. Para saber «quién dijo qué», compara una solución completa de hablantes, no la tarifa base.
Voxtral frente a Scribe: funciones de reunión o menos errores
Voxtral Mini Transcribe 2 es nuestra opción por coste para reuniones. Mistral documenta diarización, marcas por palabra y 13 idiomas. Diarización significa separar hablantes para atribuir declaraciones.
Límite importante: Mistral indica que el habla superpuesta suele producir la transcripción de una persona. Etiquetas no implican captura completa de todos a la vez.
Scribe v2 es la alternativa orientada a precisión. Cuesta solo 4 dólares más en 100 horas y tiene menor WER en la instantánea. Merece prueba si importa la edición. ElevenLabs cobra aparte términos clave y detección de entidades; compara plan y funciones, no solo 0,22 $/hora. La prueba no decide qué servicio etiqueta mejor tu reunión.
MAI-Transcribe-2: vista preliminar sólida, no predeterminado
El anuncio de Microsoft del 3 de septiembre ofrece 0,10 $/hora hasta finales de 2026. Junto con la instantánea, resulta atractivo para experimentar.
Pero la documentación de Azure Speech marca la integración como preliminar, sin SLA y no recomendada para producción. Evalúala en prototipos si región y términos encajan. No bases un flujo desatendido en la promoción ni supongas el mismo precio en 2027.
OpenAI y Google: compara modelos dedicados
En OpenAI, GPT-Transcribe es la opción dedicada nueva. GPT-4o Mini Transcribe sigue siendo más barato, unos 0,18 $/hora. Compararíamos ambos antes de elegir el antiguo GPT-4o Transcribe solo por familiaridad.
Gemini 3.5 Transcribe añade diarización y marcas por palabra. La estimación de 0,005 $/minuto combina audio de entrada y texto de salida. Merece comparación si ya usas Google, pero no es Transcribe Live ni un Gemini general con audio adjunto.
Soniox, Qwen, AssemblyAI y Deepgram: motivos para conservar alternativas
Soniox merece comparación barata, pero 0,10 $/hora es estimado. Factura audio, contexto de texto y salida. Más salida o traducción cambia el coste.
Para chino, incluye Qwen en vez de extrapolar una prueba inglesa. La tarifa de Alibaba Cloud depende de región y modelo. Qwen3-ASR-1.7B de pesos abiertos es otro despliegue, no la API Flash. El alojamiento local elimina la factura por llamada, no hardware y mantenimiento.
La documentación de AssemblyAI publica Universal-3.5 Pro a 0,21 $/hora y Universal-2 a 0,15 para pregrabado. Comprueba idioma y versión, no reutilices puntuaciones antiguas. Deepgram Nova-3 incluye diarización en pregrabado y cobra más por multilingüe. Ambos encajan en una comparación de reuniones por funciones aunque no ganen precio base.
Cuánto cuestan realmente 100 horas
Supón 100 horas mensuales de entrevistas de un canal. Primero necesitas texto; los resúmenes vienen después. Groq Turbo cuesta 4 dólares, Voxtral 18 y GPT-Transcribe 27 antes de extras. Es cálculo, no factura observada.
Con revisión a 20 dólares por hora, el sobreprecio de 14 dólares de Voxtral compra 42 minutos de revisión en todo el mes. Si ahorra más, se paga. No medimos ese ahorro; es el umbral.
Tres detalles cambian la comparación:
- Peticiones pequeñas: el mínimo de 10 segundos de Groq encarece audio fragmentado.
- Funciones: ElevenLabs añade 0,05 $/hora por términos clave; son 5 dólares en 100 horas.
- Canales: Deepgram factura canales procesados por separado; diez minutos con dos canales pueden contar como veinte.
Consulta los límites de Groq, tarifas de ElevenLabs y facturación de Deepgram. Usa la configuración real.
La transcripción en directo requiere otra comparación. El streaming de AssemblyAI, por ejemplo, factura la duración de conexión, no solo audio cargado. Procesar rápido un archivo no predice cuándo verá el oyente las palabras en directo.
Añade el coste de resumir y traducir
La API produce texto fuente. Si un LLM crea actas, traduce o extrae acciones, hay otra factura. La comparación de resúmenes explica cómo conservar decisiones y condiciones.
Usa la calculadora de precios de AILesson para esta fase. Supón 1,5 millones de tokens de entrada y 0,15 millones de salida. Introduce 1,5 y 0,15. Son totales hipotéticos, no una conversión fija de 100 horas.
La calculadora estima tokens, no minutos de audio. Añade transcripción, funciones, almacenamiento, reintentos y revisión. Si fragmentas y haces una síntesis final, incluye entradas repetidas.
Elige dos candidatos y comprueba lo difícil
Para texto básico, empieza con Groq Turbo y una alternativa de mayor precisión. Para reuniones, Voxtral y Scribe; añade MAI solo si aceptas vista preliminar. Para chino o mezcla de idiomas, incluye Qwen en vez de trasladar la clasificación inglesa.
Usa grabaciones autorizadas: una limpia, una ruidosa o solapada y otra con nombres, importes o términos técnicos. Da el mismo audio e instrucciones equivalentes. Comprueba omisiones, palabras importantes, cambios de hablante, marcas y tiempo de reparación, no solo fluidez.
Antes de enviar grabaciones privadas, confirma retención, uso para entrenamiento y región. Elige después la opción más barata que cumpla. Una transcripción de 4 dólares que requiere horas no es la ganadora económica.
Referencias
- Clasificaciones de OpenRouter: descubrimiento por uso, no precisión.
- Tabla de Artificial Analysis y metodología: instantánea y límites.
- Documentación de Groq: tarifas, modelos y mínimo.
- Voxtral y detalles: precio, reuniones y solapamiento.
- Precios de ElevenLabs: Scribe y extras.
- Anuncio de Microsoft y documentación de Azure: promoción y restricciones.
- Precios de OpenAI y Google: modelos dedicados.
- Soniox, Alibaba Cloud y StepFun: alternativas.
- AssemblyAI y Deepgram: modos y funciones.
- Qwen3-ASR-1.7B: despliegue abierto separado.







