Zurück zu allen Beiträgen
Artikel

Beste Budget-LLMs im Jahr 2026: API-Preise und Kosten pro erfolgreicher Aufgabe

Autor:

Vergleichen Sie die Kosten für GLM, Qwen, GPT, DeepSeek und Gemini API für drei Workloads. Trennen Sie Werbeaktionen, Wiederholungsversuche und Bewertungen vom Haupt-Token-Preis.

Ein Modellchip in einem kompakten Sockel mit integriertem Münzschlitz

Das günstigste Modell auf einer Preistabelle kann für Ticketetiketten ausreichen und für alles andere teuer sein – insbesondere, wenn jede dritte Antwort eine Reparatur benötigt. Eine sinnvolle Budgetauswahlliste beginnt mit überprüfbaren Arbeiten und misst dann die Gesamtkosten für deren Fertigstellung.

Für kostengünstige Text-Workloads würden wir GLM-5.3-Flash und Qwen3.8-Flash mit GPT-5.6 Luna vergleichen. DeepSeek V4 Flash ist ein weiterer Kandidat, insbesondere für Arbeiten, die außerhalb der Hauptverkehrszeiten genutzt werden können. Gemini 3.8 Flash ist ein höherpreisiger Vergleich, wenn die günstigeren Kandidaten die Anforderungen nicht erfüllen. Hierbei handelt es sich um eine Auswahlliste ausgewählter gehosteter APIs, nicht um den Anspruch, den weltweit günstigsten Endpunkt oder einen gemessenen Qualitätssieger gefunden zu haben.

Die Tarife wurden am 5. September 2026 überprüft. Die Beispiele für die Arbeitsbelastung sind hypothetisch. Sie schließen Verbraucherabonnements, kostenlose Kontingente mit unbegrenzter Nutzung, selbsthostende Hardware und multimodale Generierung aus.

Behalten Sie den Listenpreis neben der Aktion bei

Alle unten aufgeführten Preise verstehen sich in USD pro Million Token, Standardverarbeitung und nicht zwischengespeicherter Eingabe. Jeder Anbieter stellt seine eigenen Token-Zählungen in Rechnung; Gleiche Zählungen sind ein Budgetierungsinstrument und kein Beleg für gleiche Arbeit.

Modell und EndpunktEingabe / 1MAusgabe / 1MQualifikation
GLM-5.3-Flash · Z.AI0,075 $ Werbeaktion; 0,15-Dollar-Liste0,25 $ Werbeaktion; 0,50-Dollar-ListeDie aktuelle 50 %-Aktion endet am 9. September um 24:00 UTC+8
Qwen3.8-Flash · Alibaba Cloud0,15 $0,47 $Singapur, International; fordert bis zu 1 Mio. Eingabe-Tokens an
GPT-5.6 Luna · OpenAI0,20 $1,20 $Short-Context-Rate
DeepSeek V4 Flash · DeepSeek0,44 $ Höchstwert; 0,22 $ außerhalb der HauptverkehrszeitHöchstwert: 1,32 $; 0,66 $ außerhalb der HauptverkehrszeitZeitabhängige Abrechnung
Gemini 3.8 Flash · Gemini API0,75 $3,75 $Einführungspreis bis 31. Dezember 2026

Für wiederkehrende Arbeiten nutzen Sie den Listenpreis von GLM sowie das temporäre Angebot. Die Aktion endet mit dem Übergang vom 9. September zum 10. September in UTC+8. Bauen Sie Ihr Jahresbudget nicht aus den vier verbleibenden Aktionstagen auf.

Die Hauptfenster von DeepSeek sind Montag–Freitag, 01:00–04:00 und 06:00–10:00 UTC; die anderen Stunden liegen außerhalb der Hauptverkehrszeiten. Gemini listet ab dem 1. Januar 2027 einen Input von 1,50 $ und einen Output von 7,50 $ auf. Luna-Anfragen über 272.000 Input-Tokens kosten mehr für die gesamte Anfrage. Qwens Region gehört in das Zitat; ein Tarif aus einer anderen Bereitstellungsregion ist ein separater Vergleich.

Keine Zeile enthält Toolaufrufe, Steuern, Fehlversuche oder menschliche Überprüfungen. Ein über einen Router verfügbares Modell verfügt möglicherweise über eine andere Rate oder Konfiguration. Behalten Sie daher den tatsächlichen Endpunkt in Ihren Aufzeichnungen.

Drei Workloads führen zu anderen Kosten

Betrachten Sie diese erfundenen monatlichen Volumina, verteilt auf Anfragen unterhalb der relevanten Längenbeschränkungen:

  • Ticketklassifizierung: 5 Mio. Eingabe- und 0,1 Mio. in Rechnung gestellte Ausgabe-Tokens. Die meiste Arbeit besteht aus Lesen; die Antwort ist ein kurzes Etikett.
  • Berichtszusammenfassungen: 10 Mio. Input- und 0,5 Mio. in Rechnung gestellte Output-Tokens. Das Ergebnis ist kürzer als die Quelle, muss aber wichtige Bedingungen wahren.
  • Entwurfsgenerierung: 2 Mio. Input- und 2 Mio. in Rechnung gestellte Output-Tokens. Die Erstellung von Texten macht einen größeren Teil der Rechnung aus.

Unter Verwendung des Listenpreises von GLM und des Spitzenpreises von DeepSeek für die Basislinie ergibt sich:

KandidatTicketetikettenZusammenfassungenEntwürfe
GLM-5.3-Flash, Liste0,80 $1,75 $1,30 $
Qwen3.8-Flash, Singapur0,797 $1,735 $1,24 $
GPT-5.6 Luna1,12 $2,60 $2,80 $
DeepSeek V4 Flash, Spitzenwert2.332 $5,06 $3,52 $
Gemini 3.8 Flash, Einführung4,125 $9,375 $9 $

Dabei handelt es sich um Berechnungen aus den verknüpften Tarifen, nicht um Scores. Die aktuelle Aktion von GLM halbiert ihre Reihe; die qualifizierte DeepSeek-Nutzung außerhalb der Spitzenzeiten halbiert ihre Reihe. Nach der angekündigten Einführungsphase von Gemini verdoppelt sich seine Reihe. Der günstigste aufgelistete Kandidat bleibt bei manchen Arbeitslasten nahe bei einem anderen, sodass geringfügige Preisunterschiede nicht über Ausgaben entscheiden sollten, die unterschiedlich große Korrekturen erfordern.

Die in Rechnung gestellte Ausgabe umfasst alle anwendbaren Begründungs-Tokens, nicht nur die Wörter, die einem Benutzer angezeigt werden. Eine Ein-Wort-Klassifizierung kann daher mehr kosten, als ihre sichtbare Lösung vermuten lässt. Messen Sie den Verbrauch, bevor Sie ihn extrapolieren.

Ein günstiger Ausfall braucht eine klare Fehlerregel

Definieren Sie für die Ticketklassifizierung die Beschriftungen und was zu tun ist, wenn zwei Beschriftungen passen. Vergleichen Sie mit einer von Menschen überprüften Stichprobe und prüfen Sie seltene Kategorien separat. Ein Modell, das fast alles als „allgemein“ bezeichnet, kann bei einer unausgeglichenen Charge genau aussehen, während es in den wichtigen Fällen fehlschlägt.

Verwenden Sie für Zusammenfassungen die Faktenbewahrungsprüfungen und bevorzugen Sie nicht kürzere Prosa. Wenden Sie für Datensätze die Extraktionsprüfungen an: korrektes Format, korrekte Werte und ehrlicher Umgang mit fehlenden Informationen. Dies sind nützlichere Upgrade-Auslöser als „Die Antwort scheint schwach.“

Wählen Sie den zweiten Kandidaten aus, bevor Sie eine langfristige Kandidatur starten. Wenn die Baseline eine Antwort erzeugt, die eine deterministische Prüfung nicht besteht, versuchen Sie es mit gezieltem Feedback erneut oder senden Sie den ungelösten Datensatz an das zweite Modell. Wenn die Richtigkeit nicht automatisch überprüft werden kann, werden alle Fehler anhand einer Stichproben- und Überprüfungssprache anstelle einer Annahmekonfidenzsprache identifiziert.

Ein Routing-System hat auch Kosten. Möglicherweise sendet es gültige Arbeiten an das teure Modell oder übersieht eine falsche Antwort. Messen Sie diese Fälle. Behaupten Sie nicht, dass ein Billig-Plus-Premium-Workflow die Premiumqualität bewahrt, es sei denn, das gesamte System wurde evaluiert.

Wann ein teurerer Aufruf insgesamt weniger kostet

Angenommen, ein fiktives Modell A kostet 0,001 $ pro vollständigem Versuch und hat eine Akzeptanzrate von 50 %. Modell B kostet 0,0015 $ bei einer Akzeptanzrate von 90 %. Unter diesen angenommenen stabilen Raten betragen die erwarteten Erzeugungskosten pro angenommener Aufgabe 0,002 $ für A und etwa 0,00167 $ für B. Bei diesem Beispiel handelt es sich nicht um einen beobachteten Leistungsvergleich der oben genannten Modelle.

Eine vollständigere Chargenmessung ist:

Kosten pro angenommener Aufgabe =
  (API-Nutzung einschließlich Wiederholungsversuche + Tools + Überprüfungskosten)
  / Aufgaben, die die Akzeptanzprüfung bestehen

Beziehen Sie aufgegebene Aufgaben in den Ausgabenzähler ein. Wenn nichts erfolgreich ist, hat der Workflow keine nutzbaren Kosten pro abgeschlossener Aufgabe ermittelt. Verstecken Sie Fehler nicht, indem Sie API-Antworten als erfolgreiche Geschäftsergebnisse zählen.

Durch Caching und Batch-Verarbeitung können geeignete Rechnungen reduziert werden, es werden jedoch die tatsächlichen Regeln des Anbieters verwendet. Bei einer Cache-Leserate handelt es sich nicht um die Kosten für die Erstellung oder Beibehaltung des Caches, und ein verzögerter Batch ist nicht gleichbedeutend mit einer synchronen Antwort. Beginnen Sie mit nicht zwischengespeicherten Standardraten, wenn das Produktionsverkehrsmuster noch unbekannt ist.

Verwenden Sie den AILesson-Preisrechner, um den Input-/Output-Mix zu vergleichen und dabei den Anbieter und den Verarbeitungsmodus anzupassen. Ersetzen Sie dann die hypothetischen Volumina durch einen kleinen repräsentativen Lauf. Ein Pilotprojekt mit zehn Elementen kann offensichtliche Fehler und unerwartete Token-Nutzung aufdecken; es kann keine genaue Produktionserfolgsquote ermittelt werden. Erweitern Sie das Beispiel, bevor Sie einen Standard für Tausende von Aufgaben festlegen.

Beginnen Sie für einen neuen Workflow mit Qwen3.8-Flash oder GLM-5.3-Flash plus Luna als Vergleich. Behalten Sie das, was Ihre Anforderungen mit den geringsten Gesamtkosten erfüllt. Zahlen Sie mehr, wenn die Belege zeigen, dass es weniger ungelöste Aufgaben oder weniger Überprüfungen gibt – und nicht nur, weil das nächste Modell als leistungsfähiger vermarktet wird.

Referenzen