Melhores modelos de transcrição por IA em 2026: precisão e preço
Compare modelos de fala para texto por custo de API por hora, precisão e limites práticos. Escolha uma opção para gravações, reuniões ou vários idiomas.

Cem horas de gravações podem custar $4 para transcrever com Whisper Large V3 Turbo da Groq ou $18 com Voxtral Mini Transcribe 2 da Mistral, antes dos extras. A conta mais barata é atraente. Saber se ela é a melhor compra depende da transcrição de que você precisa: palavras pesquisáveis, atas de reunião com identificação de falantes ou legendas que precisam acompanhar a gravação.
Nossa escolha econômica para transcrição básica de áudio gravado é Whisper Large V3 Turbo na Groq. Em reuniões que exigem identificação de falantes e marcações de tempo por palavra, Voxtral Mini Transcribe 2 é nossa escolha inicial orientada a custo, enquanto vale comparar ElevenLabs Scribe v2 quando reduzir erros de transcrição importa mais do que a menor tarifa básica. Abaixo estão os preços e as evidências por trás dessas escolhas.
MAI-Transcribe-2 é a novidade convincente em preço e precisão publicada, mas não é nossa recomendação padrão para produção: sua integração com Azure ainda está em prévia pública, sem SLA, e a Microsoft desaconselha o uso em produção. Essa restrição importa tanto quanto a pontuação no benchmark.
Os preços e a documentação foram conferidos em 4 de setembro de 2026. Esta é uma comparação editorial de documentação pública de APIs e benchmarks independentes, não uma alegação de que testamos pessoalmente todos os modelos. Ela se concentra em gravações concluídas, não em assinaturas de aplicativos de reunião nem em agentes de voz ao vivo.
Preços de APIs de transcrição em resumo
A unidade de comparação é um modelo servido por determinado fornecedor em determinado modo. “Preço do Whisper” não é específico o bastante. Pesos abertos, uma API hospedada e um aplicativo para computador que usa esses pesos têm custos diferentes.
Estas são tarifas básicas publicadas para transcrição de arquivos, não faturas garantidas. Os valores estão em dólares americanos. Excluímos impostos, armazenamento, novas tentativas, recursos opcionais, créditos gratuitos e descontos negociados. “Aprox.” indica uma estimativa baseada em tokens; a linha do Scribe mostra o valor de uso antes de cobranças ou créditos no nível do plano.
| Modelo e serviço | Custo básico por hora de áudio | Uso básico para 100 horas | Ressalva importante |
|---|---|---|---|
| Whisper Large V3 Turbo · Groq | $0.04 | $4 | Mínimo de 10 segundos cobrados por solicitação |
| MAI-Transcribe-2 · Microsoft | $0.10 | $10 | Promocional; integração com Azure em prévia |
| Soniox · API assíncrona de arquivos | Aprox. $0.10 | Aprox. $10 | Cobrança por tokens de áudio e texto |
| Whisper Large V3 · Groq | $0.111 | $11.10 | Modelo diferente do Turbo |
| Qwen3 ASR Flash Filetrans · Alibaba Cloud | $0.126 | $12.60 | Tarifa de Singapura: $0.000035/segundo |
| GPT-4o Mini Transcribe · OpenAI | Aprox. $0.18 | Aprox. $18 | Tarifa oficial estimada |
| Voxtral Mini Transcribe 2 · Mistral | $0.18 | $18 | $0.003/minuto |
| Universal-3.5 Pro · AssemblyAI | $0.21 | $21 | Modelo pré-gravado, não Streaming |
| Scribe v2 · ElevenLabs | $0.22 | Valor de uso de $22 | Confira o plano e os complementos pagos |
| Nova-3 · Deepgram | $0.258 / $0.312 | $25.80 / $31.20 | Pré-gravado monolíngue / multilíngue |
| GPT-Transcribe · OpenAI | $0.27 | $27 | $0.0045/minuto |
| Gemini 3.5 Transcribe · Google | Aprox. $0.30 | Aprox. $30 | API para desenvolvedores; entrada de áudio mais saída de texto |
| GPT-4o Transcribe · OpenAI | Aprox. $0.36 | Aprox. $36 | Tarifa oficial estimada |
Há ainda um concorrente mais barato a conferir caso o serviço seja adequado à sua região e ao idioma: a StepFun lista StepAudio 2.5 ASR a CNY 0.15 por hora, ou CNY 15 por 100 horas. Mantemos a moeda original em vez de fingir que um preço convertido estabelece a opção mais barata disponível no mundo todo.
Esta é uma seleção representativa com tarifas públicas, não uma lista de todos os serviços de fala do mercado. Um contrato existente com a nuvem, uma região obrigatória de implantação ou vocabulário especializado podem justificar outra seleção.
O que as classificações de precisão realmente medem
As classificações de transcrição do OpenRouter ajudam a identificar os modelos que as pessoas usam. Elas ordenam pelo volume de solicitações, não pela precisão da transcrição. Vale investigar um modelo popular; popularidade não prova que ele reconhecerá os nomes dos seus clientes.
Como indicador de qualidade comparável, o recorte abaixo vem da tabela AA-WER v2 sem streaming publicada pelo Artificial Analysis:
| Modelo e fornecedor testado | Taxa de erro de palavras; menor é melhor |
|---|---|
| MAI-Transcribe-2 · Microsoft | 2.0% |
| Scribe v2 · ElevenLabs | 2.2% |
| Gemini 3.5 Transcribe · Google | 2.6% |
| GPT-Transcribe · OpenAI | 3.3% |
| Voxtral Mini Transcribe 2 · Mistral | 3.6% |
| Whisper Large V3 Turbo · Groq | 4.6% |
A taxa de erro de palavras conta substituições, exclusões e inserções comparando com uma transcrição de referência. Ela não é a probabilidade de uma frase específica estar correta. Um valor errado ou a ausência de um “não” pode importar mais para você do que várias diferenças inofensivas de formatação.
A metodologia do benchmark usa aproximadamente oito horas distribuídas por três conjuntos de dados, ponderados em 50%, 25% e 25%. Ela inclui fala parlamentar e teleconferências de resultados em inglês; alguns arquivos longos são divididos para caber nos limites dos modelos. Esses resultados não estabelecem um vencedor em chinês, árabe nem em todos os idiomas. Também não medem se a identificação de um falante está correta.
Use a tabela para reduzir as opções, não para pular uma amostra do seu próprio áudio. Mantenha a versão e o fornecedor do modelo junto à pontuação; um resultado do Universal-3 Pro, por exemplo, não deve ser renomeado como Universal-3.5 Pro.
Qual modelo escolheríamos?
Whisper Turbo na Groq: nossa escolha econômica para transcrições básicas
Por $4 para 100 horas, esta é a primeira opção que avaliaríamos para um arquivo pesquisável de gravações ou uma primeira transcrição. Seu atrativo é o baixo preço hospedado junto de uma API documentada — não uma promessa de que seus erros sejam desprezíveis.
A documentação da Groq separa Turbo de Large V3: Turbo aceita transcrição multilíngue, mas não o endpoint de tradução. Solicitações com menos de 10 segundos ainda geram cobrança de 10 segundos. Esse mínimo é pequeno para entrevistas, mas significativo quando um pipeline divide o áudio em muitos clipes curtos.
Escolha-o quando o texto econômico for a entrega principal e sua amostra passar na revisão. Se você precisar de uma resposta confiável para “quem disse o quê”, compare uma solução completa de identificação de falantes, em vez de tratar a tarifa básica de transcrição como o preço do fluxo concluído.
Voxtral contra Scribe: recursos para reuniões ou menos erros de texto
Voxtral Mini Transcribe 2 é nossa opção orientada a custo para avaliar reuniões com identificação de falantes. A Mistral documenta diarização de falantes, marcações de tempo por palavra e 13 idiomas compatíveis. Diarização significa separar os falantes para atribuir cada declaração à pessoa certa.
Há uma limitação importante: segundo a Mistral, falas sobrepostas geralmente produzem a transcrição de apenas um falante. Não confunda a presença de rótulos de falantes com a captura completa de todos que falam ao mesmo tempo.
Scribe v2 é a alternativa orientada à precisão nessa dupla. Seu custo básico de uso listado é apenas $4 maior em 100 horas, e sua WER é menor no recorte acima. Isso justifica um teste direto quando o tempo de edição importa. A ElevenLabs cobra separadamente por orientação com termos-chave e detecção de entidades; compare o plano real e os recursos selecionados, não apenas os $0.22/hora. O benchmark não decide qual serviço identifica melhor os falantes da sua reunião.
MAI-Transcribe-2: uma prévia forte, não um padrão de produção
O anúncio de lançamento da Microsoft em 3 de setembro oferece $0.10/hora até o fim de 2026. Junto ao recorte de qualidade, isso torna o MAI-Transcribe-2 uma opção experimental atraente em preço e precisão.
Porém, a documentação do Azure Speech marca explicitamente a integração como prévia pública, sem acordo de nível de serviço e não recomendada para cargas de produção. Avalie-a em um protótipo se a região e os termos necessários forem adequados. Não fundamente um pipeline de produção sem supervisão apenas no preço promocional nem suponha que o mesmo valor continuará em 2027.
OpenAI e Google: compare os modelos dedicados à transcrição
Na OpenAI, GPT-Transcribe é a opção dedicada mais recente desta comparação. GPT-4o Mini Transcribe continua sendo a alternativa mais barata, com estimativa de $0.18/hora. Compararíamos os dois antes de presumir que o GPT-4o Transcribe mais antigo é a melhor opção apenas porque “4o” soa familiar.
Gemini 3.5 Transcribe acrescenta outra opção dedicada, com diarização de falantes e marcações de palavras. A estimativa do Google de aproximadamente $0.005/minuto combina entrada de áudio e saída de texto; não é apenas a cobrança de entrada. Vale compará-lo se você já usa a API do Google, mas ele não é o mesmo produto que Transcribe Live nem um modelo geral do Gemini que recebe um arquivo de áudio.
Soniox, Qwen, AssemblyAI e Deepgram: motivos para manter alternativas
Soniox merece entrar em uma comparação de baixo custo, mas seu valor aproximado de $0.10/hora é uma estimativa. Sua cobrança inclui a entrada de áudio, o contexto textual fornecido e a saída de texto. Mais saída ou tradução altera a conta.
Em um fluxo em chinês, inclua o Qwen na amostra em vez de extrapolar um benchmark em inglês. A tarifa de transcrição de arquivos da Alibaba Cloud depende da região e do modelo exato. O Qwen3-ASR-1.7B com pesos abertos é uma escolha distinta de implantação, não a API Flash com outro nome. Hospedagem local elimina uma fatura de API por chamada, não os custos de hardware e manutenção.
A documentação atual de modelos da AssemblyAI lista Universal-3.5 Pro por $0.21/hora e Universal-2 por $0.15/hora para áudio pré-gravado. Confira os idiomas aceitos e a versão exata, em vez de importar pontuações antigas de benchmark. O preço do Nova-3 da Deepgram inclui diarização de falantes para áudio pré-gravado, enquanto sua tarifa básica multilíngue é maior que a monolíngue. Ambos devem entrar em uma comparação de reuniões com os mesmos recursos, mesmo sem vencer a coluna de menor preço básico.
Quanto custam de fato 100 horas
Considere uma carga mensal hipotética de 100 horas de entrevistas em um canal. A primeira entrega é texto; os resumos vêm depois. Pelas tarifas listadas, Groq Turbo custa $4, Voxtral $18 e GPT-Transcribe $27 antes de extras. Esse é um cálculo de uso, não uma fatura observada.
Agora, suponha que o tempo da pessoa revisora valha $20/hora. O adicional de $14 do Voxtral em relação à Groq compra 42 minutos de revisão em todo o mês. Se ele economizar mais do que isso no seu fluxo, o preço superior da API pode se pagar. Não medimos essa economia; 42 minutos são o ponto de equilíbrio que você pode testar.
Três detalhes de cobrança podem mudar a comparação:
- Solicitações pequenas: o mínimo de 10 segundos da Groq aumenta o custo de áudio muito fragmentado.
- Recursos obrigatórios: a ElevenLabs lista orientação com termos-chave por mais $0.05/hora. Em 100 horas, isso acrescenta $5 de uso antes de outras cobranças.
- Canais: a Deepgram cobra os canais processados separadamente; uma gravação de 10 minutos com dois canais pode contar como 20 minutos de processamento.
As fontes relevantes são os limites de arquivos da Groq, as tarifas da API da ElevenLabs e a explicação de cobrança da Deepgram. Use a configuração que você realmente enviará.
A transcrição ao vivo exige uma comparação separada. A cobrança de streaming da AssemblyAI, por exemplo, conta o tempo da conexão, e não apenas o áudio enviado. A capacidade de um modelo de processar rapidamente um arquivo existente não informa quando uma pessoa acompanhando ao vivo verá as primeiras palavras ou o resultado final.
Acrescente o custo de resumos e tradução
A API de transcrição produz o texto-fonte. Se um LLM o transformar em atas, traduzi-lo ou extrair tarefas, haverá outra cobrança. A comparação de modelos de resumo explica como verificar se notas encurtadas preservam decisões e condições.
Use a calculadora de preços de LLMs do AILesson nessa etapa de processamento textual. Suponha que as transcrições e os prompts mensais totalizem 1,5 milhão de tokens de entrada, e os resumos, 0,15 milhão de tokens de saída. Digite 1.5 e 0.15 nos respectivos campos para comparar custos de modelos. Esses são totais hipotéticos de tokens, não uma conversão fixa de 100 horas de áudio.
A calculadora estima os custos de tokens de entrada e saída; ela não calcula transcrição por minuto de áudio. Some a estimativa de texto ao uso de transcrição, aos recursos obrigatórios, ao armazenamento, às novas tentativas e ao tempo de revisão. Se você dividir transcrições longas e executar uma rodada final de resumo, inclua também essas entradas repetidas.
Escolha dois candidatos e confira os trechos difíceis
Para transcrições básicas, comece por Groq Turbo e uma alternativa de maior precisão. Para reuniões, compare Voxtral e Scribe; acrescente MAI apenas se uma prévia for aceitável no experimento. Para fala em chinês ou com vários idiomas, inclua o serviço Qwen relevante, em vez de supor que a ordem do inglês se repete.
Use gravações que você tem autorização para processar, incluindo uma amostra limpa, uma conversa com ruído ou sobreposição e outra com nomes, valores ou vocabulário técnico. Forneça o mesmo áudio e instruções equivalentes a cada modelo. Confira falas ausentes, palavras importantes, mudanças de falante, marcações de tempo e o tempo gasto em reparos — não apenas se a transcrição parece fluida.
Antes de enviar gravações privadas, confirme as condições do fornecedor sobre retenção, uso para treinamento e região de processamento. Depois, escolha a opção menos cara que atenda aos seus requisitos reais. Uma transcrição de $4 que exige horas de reparo não é a vencedora econômica.
Referências
- Classificações de transcrição do OpenRouter — descoberta baseada em uso, não teste de precisão.
- Classificação sem streaming do Artificial Analysis e metodologia — o recorte de qualidade e seus limites.
- Documentação de fala para texto da Groq — tarifas do Whisper, diferenças entre modelos e cobrança mínima.
- Documentação do Voxtral da Mistral e detalhes do lançamento — preço, recursos de reunião e limitações de sobreposição.
- Preços da API da ElevenLabs — tarifas de uso do Scribe e complementos.
- Condições de lançamento da Microsoft e documentação da integração com Azure — promoção e restrições da prévia.
- Preços da OpenAI e preços da API para desenvolvedores do Google — tarifas e estimativas dos modelos dedicados à transcrição.
- Preços do Soniox, preços da Alibaba Cloud e preços da StepFun — modelos alternativos de cobrança e tarifas regionais.
- Documentação de modelos da AssemblyAI e preços da Deepgram — diferenças de modelo/modo e custos de recursos.
- Ficha do modelo Qwen3-ASR-1.7B — a opção separada de implantação com pesos abertos.







