Melhores LLMs econômicos em 2026: preços de API e custo por tarefa
Compare custos de API de GLM, Qwen, GPT, DeepSeek e Gemini em três cargas. Separe promoções, tentativas e revisão do preço por token.

O modelo mais barato de uma tabela de preços pode bastar para classificar chamados e sair caro em todo o resto — especialmente se uma em cada três respostas precisar de correção. Uma boa seleção econômica começa com um trabalho que possa ser verificado e depois mede todo o custo de concluí-lo.
Para cargas de texto baratas, compararíamos GLM-5.3-Flash e Qwen3.8-Flash com GPT-5.6 Luna. DeepSeek V4 Flash é outro candidato, principalmente para trabalhos que podem usar os horários fora do pico. Gemini 3.8 Flash é uma comparação mais cara quando as opções econômicas não atendem aos requisitos. Esta é uma seleção de APIs hospedadas, não uma alegação de que encontramos o endpoint mais barato do mundo nem um vencedor medido de qualidade.
As tarifas foram conferidas em 5 de setembro de 2026. Os exemplos de carga são hipotéticos. Eles excluem assinaturas para consumidores, alegações de uso gratuito ilimitado, hardware de hospedagem própria e geração multimodal.
Mantenha o preço de tabela ao lado da promoção
Todas as tarifas abaixo estão em dólares americanos por milhão de tokens, para processamento padrão e entrada sem cache. Cada fornecedor cobra sua própria contagem de tokens; quantidades iguais servem para orçamento, não comprovam trabalho equivalente.
| Modelo e endpoint | Entrada / 1 mi | Saída / 1 mi | Ressalva |
|---|---|---|---|
| GLM-5.3-Flash · Z.AI | $0.075 promocional; $0.15 de tabela | $0.25 promocional; $0.50 de tabela | Promoção atual de 50% termina em 9 de setembro, 24:00 UTC+8 |
| Qwen3.8-Flash · Alibaba Cloud | $0.15 | $0.47 | Singapura, Internacional; solicitações com até 1 mi de tokens de entrada |
| GPT-5.6 Luna · OpenAI | $0.20 | $1.20 | Tarifa de contexto curto |
| DeepSeek V4 Flash · DeepSeek | $0.44 no pico; $0.22 fora do pico | $1.32 no pico; $0.66 fora do pico | Cobrança depende do horário |
| Gemini 3.8 Flash · Gemini API | $0.75 | $3.75 | Tarifa introdutória até 31 de dezembro de 2026 |
Para trabalho recorrente, use o preço de tabela do GLM junto à oferta temporária. A promoção termina na passagem de 9 para 10 de setembro no fuso UTC+8. Não monte o orçamento de um ano com base nos quatro dias promocionais restantes.
Os horários de pico do DeepSeek são de segunda a sexta-feira, 01:00–04:00 e 06:00–10:00 UTC; os demais horários ficam fora do pico. O Gemini lista $1.50 por entrada e $7.50 por saída a partir de 1º de janeiro de 2027. Solicitações do Luna acima de 272K tokens de entrada custam mais para toda a solicitação. A região do Qwen faz parte da cotação; a tarifa de outra região de implantação é uma comparação separada.
Nenhuma linha inclui chamadas de ferramentas, impostos, tentativas fracassadas nem verificação humana. Um modelo disponível por meio de um roteador pode ter tarifa ou configuração diferente, portanto preserve o endpoint real em seus registros.
Três cargas mudam o que você paga
Considere estes volumes mensais inventados, distribuídos por solicitações abaixo dos limites relevantes de tamanho:
- Classificação de chamados: 5 mi de tokens de entrada e 0.1 mi de tokens de saída cobrados. A maior parte do trabalho é leitura; a resposta é um rótulo curto.
- Resumos de relatórios: 10 mi de tokens de entrada e 0.5 mi de tokens de saída cobrados. O resultado é menor do que a fonte, mas precisa preservar condições importantes.
- Geração de rascunhos: 2 mi de tokens de entrada e 2 mi de tokens de saída cobrados. Produzir texto representa uma parte maior da conta.
Usar o preço de tabela do GLM e o preço de pico do DeepSeek como referência produz:
| Candidato | Rótulos de chamados | Resumos | Rascunhos |
|---|---|---|---|
| GLM-5.3-Flash, tabela | $0.80 | $1.75 | $1.30 |
| Qwen3.8-Flash, Singapura | $0.797 | $1.735 | $1.24 |
| GPT-5.6 Luna | $1.12 | $2.60 | $2.80 |
| DeepSeek V4 Flash, pico | $2.332 | $5.06 | $3.52 |
| Gemini 3.8 Flash, introdutório | $4.125 | $9.375 | $9 |
Esses são cálculos com base nas tarifas vinculadas, não pontuações. A promoção atual do GLM reduz sua linha pela metade; o uso do DeepSeek que se qualifica para fora do pico também reduz sua linha pela metade. Depois do período introdutório anunciado do Gemini, sua linha dobra. O candidato de menor preço continua próximo de outro em algumas cargas, portanto pequenas diferenças de preço não devem decidir entre saídas que exigem quantidades diferentes de correção.
A saída cobrada inclui qualquer token de raciocínio aplicável, não apenas as palavras exibidas ao usuário. Assim, uma classificação de uma palavra pode custar mais do que a resposta visível sugere. Meça o uso antes de extrapolar.
Um padrão barato precisa de uma regra clara de falha
Para classificar chamados, defina os rótulos e o que fazer quando dois deles servirem. Compare com uma amostra conferida por pessoas e examine categorias raras separadamente. Um modelo que classifica quase tudo como “geral” pode parecer preciso em um lote desequilibrado e ainda falhar nos casos importantes.
Para resumos, use as verificações de preservação de fatos, em vez de preferir a prosa mais curta. Para registros, aplique as verificações de extração: formato correto, valores corretos e tratamento honesto de informações ausentes. Esses gatilhos de troca são mais úteis do que “a resposta parece fraca”.
Escolha o segundo candidato antes de começar uma execução longa. Se a opção básica produzir uma resposta que falha em uma verificação determinística, tente novamente com feedback específico ou envie o registro sem resolução ao segundo modelo. Se não for possível conferir a correção automaticamente, examine uma amostra, em vez de supor que a linguagem confiante identifica todas as falhas.
Um sistema de roteamento também tem custo. Ele pode enviar trabalho válido ao modelo caro ou deixar passar uma resposta incorreta. Meça esses casos. Não afirme que um fluxo barato mais premium preserva a qualidade premium a menos que o sistema completo tenha sido avaliado.
Quando uma chamada mais cara custa menos
Suponha que um modelo fictício A custe $0.001 por tentativa completa e tenha taxa de aceitação de 50%. O modelo B custa $0.0015, com taxa de 90%. Com essas taxas estáveis presumidas, o custo esperado de geração por tarefa aceita é de $0.002 para A e aproximadamente $0.00167 para B. Este exemplo não é uma comparação observada do desempenho dos modelos acima.
Uma medida de lote mais completa é:
Custo por tarefa aceita =
(uso da API, incluindo novas tentativas + ferramentas + custo de revisão)
/ tarefas que passam na verificação de aceitação
Inclua as tarefas abandonadas no numerador de gastos. Se nada passar, o fluxo não estabeleceu um custo utilizável por tarefa concluída. Não esconda a falha contando respostas de API como resultados empresariais bem-sucedidos.
Cache e processamento em lote podem reduzir contas adequadas, mas use as regras reais do fornecedor. Uma tarifa de leitura do cache não é o custo de criá-lo ou mantê-lo, e um lote com atraso não equivale a uma resposta síncrona. Comece com tarifas padrão sem cache enquanto o padrão do tráfego de produção ainda for desconhecido.
Use a calculadora de preços do AILesson para comparar a proporção de entrada e saída, escolhendo o fornecedor e o modo de processamento. Depois, substitua os volumes hipotéticos por uma pequena execução representativa. Um teste com dez itens pode revelar falhas evidentes e uso inesperado de tokens; não estabelece uma taxa precisa de sucesso em produção. Amplie a amostra antes de definir o padrão para milhares de tarefas.
Em um fluxo novo, comece com Qwen3.8-Flash ou GLM-5.3-Flash e use Luna como comparação. Mantenha a opção que atender aos requisitos com o menor custo completo. Pague mais quando as evidências mostrarem menos tarefas sem resolução ou menos revisão — não apenas porque o modelo seguinte é anunciado como mais capaz.
Referências
- Preços da Z.AI: preços de tabela do GLM e promoção com data definida.
- Preços dos modelos da Alibaba Cloud: região e faixas de solicitações do Qwen.
- GPT-5.6 Luna: tarifas básicas e condições de contexto longo.
- Preços do DeepSeek: tarifas de pico e fora do pico.
- Gemini 3.8 Flash: preço introdutório e tarifas posteriores anunciadas.







