Voltar para todos os artigos
Artigo

Melhores modelos de texto para fala em 2026: voz e custo de API

Autor:

Compare ElevenLabs, Chirp 3 HD, GPT-4o Mini TTS e Gemini. Separe preços por caractere e token de áudio e inclua correções de pronúncia.

Um alto-falante compacto com uma folha de roteiro abstrata inserida na parte superior

Uma voz agradável que lê o preço errado não é uma locução concluída. Se você transforma roteiros aprovados em narração de produtos, áudio de treinamento ou anúncios, a pergunta útil é qual modelo de fala entrega as palavras exigidas com menos correções.

Para narração direta, compararíamos Chirp 3 HD com Eleven Multilingual v2. Em respostas interativas mais rápidas, acrescente Eleven Flash v2.5; para uma interpretação expressiva, considere Eleven v3. GPT-4o Mini TTS é um candidato separado, cobrado por tokens, e Gemini 3.1 Flash TTS Preview pertence a uma avaliação em que a disponibilidade de prévia seja aceitável. Esses são pontos de partida baseados em recursos e cobranças documentados, não vencedores de um teste de audição.

A documentação e os preços foram conferidos em 7 de setembro de 2026. Esta comparação abrange modelos e APIs hospedados de texto para fala. Exclui transcrição, sistemas completos de agentes de voz, assinaturas para consumidores e custos de produção de vozes personalizadas. A capa editorial não comprova a saída de nenhum modelo.

APIs de fala usam unidades de preço diferentes

As linhas baseadas em caracteres abaixo consideram 100.000 caracteres de entrada cobrados, antes de franquias gratuitas, assinaturas, promoções, impostos e novas tentativas. As linhas baseadas em tokens não recebem deliberadamente um preço equivalente por caractere inventado.

Modelo e serviço diretoTarifa de uso listadaCusto para 100.000 caracteres
Chirp 3 HD · Google Cloud$30 / 1 mi de caracteres$3 antes da franquia
Eleven Flash / Turbo · ElevenAPI$0.05 / 1 mil caracteres$5
Eleven Multilingual v2 / Eleven v3 · ElevenAPI$0.10 / 1 mil caracteres$10
GPT-4o Mini TTS · OpenAI$0.60 / 1 mi de tokens de entrada de texto; $12 / 1 mi de tokens de saída de áudioMeça os tokens
Gemini 3.1 Flash TTS Preview · Gemini API$1 / 1 mi de tokens de entrada de texto; $20 / 1 mi de tokens de saída de áudioMeça os tokens

O Google informa uma franquia mensal elegível para o Chirp 3 HD; o valor de $3 isola a tarifa paga, não prevê a conta de uma conta pequena. A página atual da ElevenAPI especifica cobrança em dólares. Não a substitua pelos créditos usados em outro produto da ElevenLabs nem suponha que uma promoção de assinatura anunciada se aplique a todas as contas.

Caractere, token de texto e token de áudio são unidades diferentes. O mesmo roteiro pode produzir durações distintas de áudio quando voz, pausas ou velocidade da fala mudam. Para fala cobrada por tokens, meça uma geração representativa e use o consumo informado. As tarifas acima não estabelecem qual opção é mais barata para essa gravação.

Escolha um candidato para a parte difícil do roteiro

O guia de modelos da ElevenLabs posiciona Multilingual v2 para fala longa e consistente, v3 para expressão e Flash v2.5 para baixa latência. Isso justifica testá-los em trabalhos diferentes; não comprova como pronunciam sua terminologia. O guia também destaca as limitações de normalização de números do Flash v2.5.

Para um passo a passo de produto, começaríamos por Chirp 3 HD e Multilingual v2 com o mesmo roteiro aprovado. Procure palavras ausentes, pronúncia variável, junções estranhas entre frases e um ritmo que dificulte acompanhar uma etapa. Se ambos atenderem a esses requisitos, o fluxo completo mais barato será uma escolha razoável.

Para uma resposta conversacional, compare Flash v2.5 com seu endpoint atual de TTS nas mesmas condições de rede. Meça separadamente o tempo até o início do áudio e o tempo até a conclusão. O número de latência do modelo fornecido pela empresa não é o atraso de ponta a ponta do seu aplicativo, que também inclui preparar a resposta e transportar o áudio.

Para uma introdução dramática, v3 é um candidato porque a expressão faz parte de sua finalidade documentada. Mantenha as palavras fixas enquanto muda a interpretação. Se uma performance acrescentar uma exclamação não aprovada ou alterar o sentido de uma ressalva, essa tomada falha mesmo que pareça envolvente.

GPT-4o Mini TTS pode entrar em qualquer um desses testes de roteiro curto quando seus limites de entrada e saída forem adequados. A opção de prévia do Gemini exige a mesma verificação auditiva e uma análise explícita da disponibilidade atual antes de um compromisso de produção. Não é preciso trocar um pipeline que funciona apenas para acrescentar o nome de um modelo mais recente.

Uma frase de teste pode revelar um erro caro

Considere este anúncio inventado:

A oficina começa em 18 de setembro, às 9h30. A taxa é de 19 dólares e 50 centavos. Não entre na sala B quatorze; use a sala B quarenta.

Escreva a forma falada aceitável antes de gerar o áudio. Data, horário, valor, negação e os dois números de sala precisam permanecer corretos. Para uma versão em chinês, aprove primeiro o roteiro chinês e examine a pronúncia separadamente. Uma boa voz em inglês não estabelece uma boa interpretação em chinês.

Neste exemplo, números possivelmente ambíguos foram escritos por extenso. Em sua própria entrada, compare a forma aprovada com a fonte abreviada, como um código de sala. A preparação pode resolver o problema por menos do que gerações repetidas. Porém, escrever um preço por extenso não pode alterar o próprio preço.

Depois da verificação curta, teste um roteiro mais longo da mesma tarefa. Um modelo pode dar conta de uma frase e ainda perder consistência entre parágrafos. Mantenha as mesmas quebras de parágrafo ao comparar candidatos e depois teste separadamente qualquer divisão usada na produção. Juntar arquivos de áudio cria outro ponto em que pausas ou continuidade da voz podem falhar.

Não avalie apenas passando a gravação por uma transcrição. A transcrição pode ajudar a encontrar omissões, mas não julga por completo o ritmo, a ênfase nem junções que distraem. Alguém que compreenda o idioma de destino precisa ouvir.

Faça o orçamento da gravação que será aprovada

Suponha um lote hipotético com 100.000 caracteres de narração. Pelas tarifas por caractere da tabela, gerar tudo uma vez custa $3, $5 ou $10 antes das franquias. Se os reparos de pronúncia exigirem gerar mais 20.000 caracteres, os totais de uso passam a $3.60, $6 ou $12. É apenas aritmética sobre um volume presumido de reparos, não uma taxa de falha medida desses modelos.

Ouvir e editar pode representar o maior custo. Registre caracteres ou tokens gerados, minutos de áudio aprovados, segmentos rejeitados e tempo de revisão. Divida o custo total pelos minutos aprovados. Uma interpretação mais lenta não deve parecer mais eficiente apenas porque produz mais minutos com o mesmo roteiro.

Se sua fonte começar como uma gravação, escolha um modelo de transcrição antes de escrever a narração. Se o roteiro precisar de outro idioma, use a comparação de tradução nessa etapa. Qualidade da tradução e qualidade da fala precisam de aprovações distintas: uma tradução errada pronunciada perfeitamente ainda está errada.

Comece com duas vozes nas frases difíceis e depois use um roteiro representativo completo. Escolha o candidato que preserve as palavras, cumpra os requisitos de interpretação e deixe a menor conta total de geração e correção.

Referências