Voltar para todos os artigos
Artigo

Melhores modelos de transcrição por IA em 2026: precisão e preço

Autor:

Compare modelos de fala para texto por custo de API por hora, precisão e limites práticos. Escolha uma opção para gravações, reuniões ou vários idiomas.

Um gravador de áudio compacto com forma de onda na tela, uma faixa de transcrição surgindo e uma pequena etiqueta de preço

Cem horas de gravações podem custar $4 para transcrever com Whisper Large V3 Turbo da Groq ou $18 com Voxtral Mini Transcribe 2 da Mistral, antes dos extras. A conta mais barata é atraente. Saber se ela é a melhor compra depende da transcrição de que você precisa: palavras pesquisáveis, atas de reunião com identificação de falantes ou legendas que precisam acompanhar a gravação.

Nossa escolha econômica para transcrição básica de áudio gravado é Whisper Large V3 Turbo na Groq. Em reuniões que exigem identificação de falantes e marcações de tempo por palavra, Voxtral Mini Transcribe 2 é nossa escolha inicial orientada a custo, enquanto vale comparar ElevenLabs Scribe v2 quando reduzir erros de transcrição importa mais do que a menor tarifa básica. Abaixo estão os preços e as evidências por trás dessas escolhas.

MAI-Transcribe-2 é a novidade convincente em preço e precisão publicada, mas não é nossa recomendação padrão para produção: sua integração com Azure ainda está em prévia pública, sem SLA, e a Microsoft desaconselha o uso em produção. Essa restrição importa tanto quanto a pontuação no benchmark.

Os preços e a documentação foram conferidos em 4 de setembro de 2026. Esta é uma comparação editorial de documentação pública de APIs e benchmarks independentes, não uma alegação de que testamos pessoalmente todos os modelos. Ela se concentra em gravações concluídas, não em assinaturas de aplicativos de reunião nem em agentes de voz ao vivo.

Preços de APIs de transcrição em resumo

A unidade de comparação é um modelo servido por determinado fornecedor em determinado modo. “Preço do Whisper” não é específico o bastante. Pesos abertos, uma API hospedada e um aplicativo para computador que usa esses pesos têm custos diferentes.

Estas são tarifas básicas publicadas para transcrição de arquivos, não faturas garantidas. Os valores estão em dólares americanos. Excluímos impostos, armazenamento, novas tentativas, recursos opcionais, créditos gratuitos e descontos negociados. “Aprox.” indica uma estimativa baseada em tokens; a linha do Scribe mostra o valor de uso antes de cobranças ou créditos no nível do plano.

Modelo e serviçoCusto básico por hora de áudioUso básico para 100 horasRessalva importante
Whisper Large V3 Turbo · Groq$0.04$4Mínimo de 10 segundos cobrados por solicitação
MAI-Transcribe-2 · Microsoft$0.10$10Promocional; integração com Azure em prévia
Soniox · API assíncrona de arquivosAprox. $0.10Aprox. $10Cobrança por tokens de áudio e texto
Whisper Large V3 · Groq$0.111$11.10Modelo diferente do Turbo
Qwen3 ASR Flash Filetrans · Alibaba Cloud$0.126$12.60Tarifa de Singapura: $0.000035/segundo
GPT-4o Mini Transcribe · OpenAIAprox. $0.18Aprox. $18Tarifa oficial estimada
Voxtral Mini Transcribe 2 · Mistral$0.18$18$0.003/minuto
Universal-3.5 Pro · AssemblyAI$0.21$21Modelo pré-gravado, não Streaming
Scribe v2 · ElevenLabs$0.22Valor de uso de $22Confira o plano e os complementos pagos
Nova-3 · Deepgram$0.258 / $0.312$25.80 / $31.20Pré-gravado monolíngue / multilíngue
GPT-Transcribe · OpenAI$0.27$27$0.0045/minuto
Gemini 3.5 Transcribe · GoogleAprox. $0.30Aprox. $30API para desenvolvedores; entrada de áudio mais saída de texto
GPT-4o Transcribe · OpenAIAprox. $0.36Aprox. $36Tarifa oficial estimada

Há ainda um concorrente mais barato a conferir caso o serviço seja adequado à sua região e ao idioma: a StepFun lista StepAudio 2.5 ASR a CNY 0.15 por hora, ou CNY 15 por 100 horas. Mantemos a moeda original em vez de fingir que um preço convertido estabelece a opção mais barata disponível no mundo todo.

Esta é uma seleção representativa com tarifas públicas, não uma lista de todos os serviços de fala do mercado. Um contrato existente com a nuvem, uma região obrigatória de implantação ou vocabulário especializado podem justificar outra seleção.

O que as classificações de precisão realmente medem

As classificações de transcrição do OpenRouter ajudam a identificar os modelos que as pessoas usam. Elas ordenam pelo volume de solicitações, não pela precisão da transcrição. Vale investigar um modelo popular; popularidade não prova que ele reconhecerá os nomes dos seus clientes.

Como indicador de qualidade comparável, o recorte abaixo vem da tabela AA-WER v2 sem streaming publicada pelo Artificial Analysis:

Modelo e fornecedor testadoTaxa de erro de palavras; menor é melhor
MAI-Transcribe-2 · Microsoft2.0%
Scribe v2 · ElevenLabs2.2%
Gemini 3.5 Transcribe · Google2.6%
GPT-Transcribe · OpenAI3.3%
Voxtral Mini Transcribe 2 · Mistral3.6%
Whisper Large V3 Turbo · Groq4.6%

A taxa de erro de palavras conta substituições, exclusões e inserções comparando com uma transcrição de referência. Ela não é a probabilidade de uma frase específica estar correta. Um valor errado ou a ausência de um “não” pode importar mais para você do que várias diferenças inofensivas de formatação.

A metodologia do benchmark usa aproximadamente oito horas distribuídas por três conjuntos de dados, ponderados em 50%, 25% e 25%. Ela inclui fala parlamentar e teleconferências de resultados em inglês; alguns arquivos longos são divididos para caber nos limites dos modelos. Esses resultados não estabelecem um vencedor em chinês, árabe nem em todos os idiomas. Também não medem se a identificação de um falante está correta.

Use a tabela para reduzir as opções, não para pular uma amostra do seu próprio áudio. Mantenha a versão e o fornecedor do modelo junto à pontuação; um resultado do Universal-3 Pro, por exemplo, não deve ser renomeado como Universal-3.5 Pro.

Qual modelo escolheríamos?

Whisper Turbo na Groq: nossa escolha econômica para transcrições básicas

Por $4 para 100 horas, esta é a primeira opção que avaliaríamos para um arquivo pesquisável de gravações ou uma primeira transcrição. Seu atrativo é o baixo preço hospedado junto de uma API documentada — não uma promessa de que seus erros sejam desprezíveis.

A documentação da Groq separa Turbo de Large V3: Turbo aceita transcrição multilíngue, mas não o endpoint de tradução. Solicitações com menos de 10 segundos ainda geram cobrança de 10 segundos. Esse mínimo é pequeno para entrevistas, mas significativo quando um pipeline divide o áudio em muitos clipes curtos.

Escolha-o quando o texto econômico for a entrega principal e sua amostra passar na revisão. Se você precisar de uma resposta confiável para “quem disse o quê”, compare uma solução completa de identificação de falantes, em vez de tratar a tarifa básica de transcrição como o preço do fluxo concluído.

Voxtral contra Scribe: recursos para reuniões ou menos erros de texto

Voxtral Mini Transcribe 2 é nossa opção orientada a custo para avaliar reuniões com identificação de falantes. A Mistral documenta diarização de falantes, marcações de tempo por palavra e 13 idiomas compatíveis. Diarização significa separar os falantes para atribuir cada declaração à pessoa certa.

Há uma limitação importante: segundo a Mistral, falas sobrepostas geralmente produzem a transcrição de apenas um falante. Não confunda a presença de rótulos de falantes com a captura completa de todos que falam ao mesmo tempo.

Scribe v2 é a alternativa orientada à precisão nessa dupla. Seu custo básico de uso listado é apenas $4 maior em 100 horas, e sua WER é menor no recorte acima. Isso justifica um teste direto quando o tempo de edição importa. A ElevenLabs cobra separadamente por orientação com termos-chave e detecção de entidades; compare o plano real e os recursos selecionados, não apenas os $0.22/hora. O benchmark não decide qual serviço identifica melhor os falantes da sua reunião.

MAI-Transcribe-2: uma prévia forte, não um padrão de produção

O anúncio de lançamento da Microsoft em 3 de setembro oferece $0.10/hora até o fim de 2026. Junto ao recorte de qualidade, isso torna o MAI-Transcribe-2 uma opção experimental atraente em preço e precisão.

Porém, a documentação do Azure Speech marca explicitamente a integração como prévia pública, sem acordo de nível de serviço e não recomendada para cargas de produção. Avalie-a em um protótipo se a região e os termos necessários forem adequados. Não fundamente um pipeline de produção sem supervisão apenas no preço promocional nem suponha que o mesmo valor continuará em 2027.

OpenAI e Google: compare os modelos dedicados à transcrição

Na OpenAI, GPT-Transcribe é a opção dedicada mais recente desta comparação. GPT-4o Mini Transcribe continua sendo a alternativa mais barata, com estimativa de $0.18/hora. Compararíamos os dois antes de presumir que o GPT-4o Transcribe mais antigo é a melhor opção apenas porque “4o” soa familiar.

Gemini 3.5 Transcribe acrescenta outra opção dedicada, com diarização de falantes e marcações de palavras. A estimativa do Google de aproximadamente $0.005/minuto combina entrada de áudio e saída de texto; não é apenas a cobrança de entrada. Vale compará-lo se você já usa a API do Google, mas ele não é o mesmo produto que Transcribe Live nem um modelo geral do Gemini que recebe um arquivo de áudio.

Soniox, Qwen, AssemblyAI e Deepgram: motivos para manter alternativas

Soniox merece entrar em uma comparação de baixo custo, mas seu valor aproximado de $0.10/hora é uma estimativa. Sua cobrança inclui a entrada de áudio, o contexto textual fornecido e a saída de texto. Mais saída ou tradução altera a conta.

Em um fluxo em chinês, inclua o Qwen na amostra em vez de extrapolar um benchmark em inglês. A tarifa de transcrição de arquivos da Alibaba Cloud depende da região e do modelo exato. O Qwen3-ASR-1.7B com pesos abertos é uma escolha distinta de implantação, não a API Flash com outro nome. Hospedagem local elimina uma fatura de API por chamada, não os custos de hardware e manutenção.

A documentação atual de modelos da AssemblyAI lista Universal-3.5 Pro por $0.21/hora e Universal-2 por $0.15/hora para áudio pré-gravado. Confira os idiomas aceitos e a versão exata, em vez de importar pontuações antigas de benchmark. O preço do Nova-3 da Deepgram inclui diarização de falantes para áudio pré-gravado, enquanto sua tarifa básica multilíngue é maior que a monolíngue. Ambos devem entrar em uma comparação de reuniões com os mesmos recursos, mesmo sem vencer a coluna de menor preço básico.

Quanto custam de fato 100 horas

Considere uma carga mensal hipotética de 100 horas de entrevistas em um canal. A primeira entrega é texto; os resumos vêm depois. Pelas tarifas listadas, Groq Turbo custa $4, Voxtral $18 e GPT-Transcribe $27 antes de extras. Esse é um cálculo de uso, não uma fatura observada.

Agora, suponha que o tempo da pessoa revisora valha $20/hora. O adicional de $14 do Voxtral em relação à Groq compra 42 minutos de revisão em todo o mês. Se ele economizar mais do que isso no seu fluxo, o preço superior da API pode se pagar. Não medimos essa economia; 42 minutos são o ponto de equilíbrio que você pode testar.

Três detalhes de cobrança podem mudar a comparação:

  • Solicitações pequenas: o mínimo de 10 segundos da Groq aumenta o custo de áudio muito fragmentado.
  • Recursos obrigatórios: a ElevenLabs lista orientação com termos-chave por mais $0.05/hora. Em 100 horas, isso acrescenta $5 de uso antes de outras cobranças.
  • Canais: a Deepgram cobra os canais processados separadamente; uma gravação de 10 minutos com dois canais pode contar como 20 minutos de processamento.

As fontes relevantes são os limites de arquivos da Groq, as tarifas da API da ElevenLabs e a explicação de cobrança da Deepgram. Use a configuração que você realmente enviará.

A transcrição ao vivo exige uma comparação separada. A cobrança de streaming da AssemblyAI, por exemplo, conta o tempo da conexão, e não apenas o áudio enviado. A capacidade de um modelo de processar rapidamente um arquivo existente não informa quando uma pessoa acompanhando ao vivo verá as primeiras palavras ou o resultado final.

Acrescente o custo de resumos e tradução

A API de transcrição produz o texto-fonte. Se um LLM o transformar em atas, traduzi-lo ou extrair tarefas, haverá outra cobrança. A comparação de modelos de resumo explica como verificar se notas encurtadas preservam decisões e condições.

Use a calculadora de preços de LLMs do AILesson nessa etapa de processamento textual. Suponha que as transcrições e os prompts mensais totalizem 1,5 milhão de tokens de entrada, e os resumos, 0,15 milhão de tokens de saída. Digite 1.5 e 0.15 nos respectivos campos para comparar custos de modelos. Esses são totais hipotéticos de tokens, não uma conversão fixa de 100 horas de áudio.

A calculadora estima os custos de tokens de entrada e saída; ela não calcula transcrição por minuto de áudio. Some a estimativa de texto ao uso de transcrição, aos recursos obrigatórios, ao armazenamento, às novas tentativas e ao tempo de revisão. Se você dividir transcrições longas e executar uma rodada final de resumo, inclua também essas entradas repetidas.

Escolha dois candidatos e confira os trechos difíceis

Para transcrições básicas, comece por Groq Turbo e uma alternativa de maior precisão. Para reuniões, compare Voxtral e Scribe; acrescente MAI apenas se uma prévia for aceitável no experimento. Para fala em chinês ou com vários idiomas, inclua o serviço Qwen relevante, em vez de supor que a ordem do inglês se repete.

Use gravações que você tem autorização para processar, incluindo uma amostra limpa, uma conversa com ruído ou sobreposição e outra com nomes, valores ou vocabulário técnico. Forneça o mesmo áudio e instruções equivalentes a cada modelo. Confira falas ausentes, palavras importantes, mudanças de falante, marcações de tempo e o tempo gasto em reparos — não apenas se a transcrição parece fluida.

Antes de enviar gravações privadas, confirme as condições do fornecedor sobre retenção, uso para treinamento e região de processamento. Depois, escolha a opção menos cara que atenda aos seus requisitos reais. Uma transcrição de $4 que exige horas de reparo não é a vencedora econômica.

Referências