Meilleurs LLM économiques en 2026 : tarifs API et coût par tâche réussie
Comparez les coûts API de GLM, Qwen, GPT, DeepSeek et Gemini sur trois charges. Séparez promotions, reprises et contrôle du tarif affiché.

Le modèle le moins cher d’un tableau peut suffire à classer des tickets et coûter cher ailleurs, surtout si une réponse sur trois exige une réparation. Une sélection économique utile part d’un travail vérifiable, puis mesure tout le coût nécessaire pour le terminer.
Pour les charges textuelles peu coûteuses, nous comparerions GLM-5.3-Flash et Qwen3.8-Flash à GPT-5.6 Luna. DeepSeek V4 Flash est un autre candidat, notamment hors pointe. Gemini 3.8 Flash fournit une comparaison plus chère si les options économiques échouent. Cette sélection d’API hébergées ne prétend ni trouver le point d’accès mondial le moins cher ni mesurer un vainqueur qualitatif.
Tarifs vérifiés le 5 septembre 2026. Les charges sont fictives et excluent abonnements grand public, promesses d’usage gratuit illimité, matériel auto-hébergé et génération multimodale.
Garder le prix catalogue à côté de la promotion
Tous les tarifs sont en dollars par million de jetons, traitement standard et entrée sans cache. Chaque fournisseur compte ses propres jetons ; des volumes égaux servent au budget, pas à prouver un travail égal.
| Modèle et point d’accès | Entrée / 1 M | Sortie / 1 M | Réserve |
|---|---|---|---|
| GLM-5.3-Flash · Z.AI | 0,075 $ promotion ; 0,15 $ catalogue | 0,25 $ promotion ; 0,50 $ catalogue | Promotion de 50 % jusqu’au 9 septembre, 24:00 UTC+8 |
| Qwen3.8-Flash · Alibaba Cloud | 0,15 $ | 0,47 $ | Singapour, International ; requêtes jusqu’à 1 M d’entrée |
| GPT-5.6 Luna · OpenAI | 0,20 $ | 1,20 $ | Tarif de contexte court |
| DeepSeek V4 Flash · DeepSeek | 0,44 $ pointe ; 0,22 $ hors pointe | 1,32 $ pointe ; 0,66 $ hors pointe | Facturation selon l’heure |
| Gemini 3.8 Flash · Gemini API | 0,75 $ | 3,75 $ | Tarif de lancement jusqu’au 31 décembre 2026 |
Pour un usage récurrent, employez le prix catalogue de GLM avec l’offre temporaire. Elle prend fin lors du passage du 9 au 10 septembre en UTC+8 : quatre jours promotionnels ne construisent pas un budget annuel.
Les heures pleines DeepSeek sont lundi–vendredi, 01:00–04:00 et 06:00–10:00 UTC ; le reste est hors pointe. Gemini annonce 1,50 $ en entrée et 7,50 $ en sortie dès le 1er janvier 2027. Luna facture davantage toute requête dépassant 272 K jetons d’entrée. La région Qwen fait partie du devis.
Aucune ligne n’inclut outils, taxes, échecs ou contrôle humain. Un routeur peut servir un autre tarif ou réglage : consignez le point d’accès réel.
Trois charges modifient ce que vous payez
Volumes mensuels fictifs, répartis sous les limites de longueur :
- Classement de tickets : 5 M en entrée et 0,1 M en sortie. La lecture domine, la réponse est une étiquette.
- Résumé de rapports : 10 M en entrée et 0,5 M en sortie. Le texte raccourcit mais doit garder les conditions.
- Génération de brouillons : 2 M en entrée et 2 M en sortie. La production pèse davantage.
Avec le prix catalogue GLM et le prix de pointe DeepSeek :
| Candidat | Étiquettes | Résumés | Brouillons |
|---|---|---|---|
| GLM-5.3-Flash, catalogue | 0,80 $ | 1,75 $ | 1,30 $ |
| Qwen3.8-Flash, Singapour | 0,797 $ | 1,735 $ | 1,24 $ |
| GPT-5.6 Luna | 1,12 $ | 2,60 $ | 2,80 $ |
| DeepSeek V4 Flash, pointe | 2,332 $ | 5,06 $ | 3,52 $ |
| Gemini 3.8 Flash, lancement | 4,125 $ | 9,375 $ | 9 $ |
Ce sont des calculs, pas des scores. La promotion GLM divise sa ligne par deux, comme l’usage DeepSeek hors pointe. Après la période Gemini, sa ligne double. Lorsque les écarts sont minuscules, ils ne doivent pas départager des sorties qui demandent des corrections très différentes.
La sortie facturée inclut le raisonnement applicable, pas seulement les mots affichés. Une classification d’un mot peut donc coûter plus qu’elle n’en a l’air. Mesurez avant extrapolation.
Un modèle économique a besoin d’une règle d’échec claire
Pour les tickets, définissez étiquettes et traitement des cas doubles. Comparez à un échantillon humain et inspectez les catégories rares. Un modèle qui choisit presque toujours « général » peut sembler exact sur un lot déséquilibré tout en ratant l’essentiel.
Pour les résumés, utilisez les contrôles de conservation des faits. Pour les enregistrements, appliquez les contrôles d’extraction : format, valeurs et traitement honnête du manque. Ces déclencheurs d’escalade valent mieux que « la réponse semble faible ».
Choisissez le second candidat avant un long lot. Si le premier échoue à un contrôle déterministe, réessayez avec un retour ciblé ou transmettez le cas non résolu. Sans contrôle automatique, échantillonnez et relisez au lieu de croire que l’assurance du ton signale les erreurs.
Un routeur coûte lui aussi : il peut envoyer un travail valide au modèle cher ou manquer une erreur. Mesurez ces cas. Ne prétendez pas qu’un tandem économique-premium conserve la qualité premium sans évaluer tout le système.
Quand un appel plus cher coûte moins
Un modèle fictif A coûte 0,001 $ par essai et réussit à 50 %. B coûte 0,0015 $ et réussit à 90 %. Avec ces taux supposés stables, le coût de génération par tâche acceptée est 0,002 $ pour A et environ 0,00167 $ pour B. Ce n’est pas une mesure des modèles cités.
Coût par tâche acceptée =
(usage API avec reprises + outils + coût de contrôle)
/ tâches qui passent le contrôle d’acceptation
Incluez les tâches abandonnées au numérateur. Si rien ne passe, le flux n’a pas établi de coût utilisable par tâche terminée. Ne comptez pas les réponses API comme résultats métier réussis.
Cache et traitement par lot peuvent réduire certaines factures, selon les règles réelles. Lire un cache ne coûte pas sa création ou sa conservation ; un lot différé n’équivaut pas à une réponse synchrone. Commencez par les tarifs standard sans cache si le trafic est inconnu.
Utilisez le calculateur de prix AILesson avec le bon mélange entrée-sortie, fournisseur et mode. Remplacez ensuite les volumes par une petite exécution représentative. Dix éléments révèlent échecs évidents et jetons inattendus, sans établir un taux de production précis. Élargissez l’échantillon avant des milliers de tâches.
Pour un nouveau flux, commencez par Qwen3.8-Flash ou GLM-5.3-Flash avec Luna comme comparaison. Gardez celui qui satisfait les exigences au moindre coût complet. Payez davantage seulement si les preuves montrent moins de cas non résolus ou de contrôle.
Références
- Tarifs Z.AI : prix catalogue GLM et promotion datée.
- Tarifs Alibaba Cloud : région et paliers Qwen.
- GPT-5.6 Luna : tarifs et contexte long.
- Tarifs DeepSeek : pointe et hors pointe.
- Gemini 3.8 Flash : tarif de lancement et tarif ultérieur annoncé.







