Die Erzählung der Branche lautet, Token würden immer billiger, und das stimmt zur Hälfte: Jede Generation kleiner Modelle kommt günstiger als die vorige. Doch 2026 haben sich vier Wege verfestigt, auf denen Ihre Rechnung steigt, ohne dass Sie eine einzige Zeile Code ändern. Keiner davon ist ein Trick: Alle stehen auf den Preisseiten der Anbieter. Das Problem ist, dass keiner davon in dem Vergleich auftaucht, den Sie sich am Tag der Modellwahl angesehen haben.
1. Aktionspreise haben ein Datum
OpenAI verkauft GPT-5.6 Sol derzeit für 4 $ Eingabe und 20 $ Ausgabe je Million Token. Auf der Preisseite steht wörtlich, dieser Aktionspreis sei „mindestens bis zum 21. November 2026” verfügbar.
„Mindestens” ist ein Boden, keine Decke: Er kann verlängert werden, und er kann an diesem Tag enden. Wer das Jahr mit dem Aktionstarif budgetiert hat, hat ein Datum im Kalender und ein unbeziffertes Risiko, denn was das Modell danach kostet, ist nicht veröffentlicht.
2. Langer Kontext wird in einer anderen Stufe abgerechnet
Dieser Punkt überrascht am meisten, weil er nicht vom Modell abhängt, sondern davon, wie viel Sie ihm schicken.
OpenAI veröffentlicht zwei Stufen je Modell, kurzer und langer Kontext. Bei GPT-5.6 Sol steigt die Eingabe von 4 $ auf 8 $ und die Ausgabe von 20 $ auf 30 $. Google markiert es über eine Schwelle: Bei Gemini 3.1 Pro kostet die Eingabe unter 200.000 Token 2 $ und darüber 4 $, die Ausgabe steigt von 12 $ auf 18 $.
Das Entscheidende: Auf der OpenAI-Seite stehen beide Stufen, aber nicht die Schwelle, die sie trennt. Sie wissen, dass es einen anderen Preis gibt, aber nicht, ab welchem Punkt genau er greift. Und in der Praxis rutscht man von allein hinein: ein RAG, das immer mehr Dokumente ansammelt, ein Gesprächsverlauf, den niemand kürzt, ein System-Prompt, der von Flickstelle zu Flickstelle wächst. Gleiche Aufgabe, gleiches Modell, anderer Stückpreis.
Anthropic ist den umgekehrten Weg gegangen: Seit Claude 4.6 ist das Fenster von einer Million Token zum Standardpreis enthalten, ohne Aufschlag. Das ist beim Vergleichen wichtig zu wissen.
3. Aufschläge dafür, wo und wie verarbeitet wird
Das sind Konfigurations-Flags, keine Modellentscheidungen, und jedes hat seinen Preis.
Datenresidenz. OpenAI berechnet 10 % Aufschlag auf regionale Endpunkte, für Modelle, die ab dem 5. März 2026 veröffentlicht wurden und sie unterstützen. Anthropic wendet auf Inferenz, die auf die USA beschränkt ist, einen Multiplikator von 1,1 an.
Schneller Modus. Bei OpenAI verdoppelt er den Standardtarif. Bei Anthropic steigt der schnelle Modus von Opus 5 von 5 $/25 $ auf 10 $/50 $: exakt das Doppelte.
Keiner von beiden ändert, was das Modell tut, sondern nur, wo es läuft oder mit welcher Priorität. Ein falsch gesetztes Flag in einer Integration verdoppelt die Rechnung dieses Pfades, und es fällt erst zum Monatsabschluss auf.
4. Erhöhungen mit angekündigtem Datum
Google gibt die aktuellen Preise als gültig bis zum 31. Dezember 2026 an und hat bereits angekündigt, dass sie sich ab dem 1. Januar 2027 auf der ganzen Linie näherungsweise verdoppeln. Gemini 3.8 Flash steigt in der Eingabe von 0,75 $ auf 1,50 $. Die Speicherung des Kontext-Caches steigt von 0,50 $ auf 1 $ je Million Token und Stunde.
Das ist die größte der vier Erhöhungen und zugleich die am leichtesten planbare, weil sie fast vier Monate im Voraus veröffentlicht wurde. Es ist auch die, der die meisten in der Januarrechnung begegnen werden, ohne vorher hingesehen zu haben.
Und manchmal kommt die Erhöhung nicht
Anthropic hatte angekündigt, Claude Sonnet 5 werde zum 1. September 2026 von 2 $/10 $ auf 3 $/15 $ steigen. Das ist nicht eingetreten: Der Einführungstarif ist als Standardpreis geblieben.
Das ist eine gute Nachricht und zugleich das beste Argument dieses Artikels. Der Token-Preis ist eine Variable, keine Konstante: Er steigt, er fällt, und manchmal wird er angekündigt und wieder zurückgezogen. Es beim Lesen zu erfahren, ist billig. Es über die Rechnung zu erfahren, nicht.
Was daraus folgt
Legen Sie das Ablaufdatum neben den Preis. In Ihrer Kostenübersicht sollte jeder Tarif tragen, woher er stammt, wann Sie ihn geprüft haben und bis wann er gilt. Ein Preis ohne Datum ist ein Wert, der lautlos verfällt.
Messen Sie Kosten je Million Token, nicht die Gesamtausgaben. Wenn Ihre Nutzung um 20 % wächst und der Preis um 15 % steigt, steigen die Gesamtausgaben, und Sie wissen nicht, was worauf entfällt. Der Stückpreis trennt beides.
Prüfen Sie die Flags vor den Modellen. Langer Kontext, Residenz und schneller Modus sind drei Prüfungen von zehn Minuten, die scheinbar unerklärliche Anstiege erklären.
Die strukturellen Rabatte gibt es weiterhin. Cache-Lesevorgänge kosten bei OpenAI wie bei Anthropic ein Zehntel der Eingabe, und die Stapelverarbeitung liegt bei allen drei Anbietern bei 50 %. Ein großer Teil der echten Ersparnis liegt hier, ohne Modell- oder Anbieterwechsel.
Anbieterwechsel ist nicht Modellwechsel. Dasselbe Modell, anderswo bereitgestellt, kann einen anderen Preis, eine andere Residenz und andere Aufschläge haben. Das sind zwei getrennte Entscheidungen, und man sollte sie nicht vermischen.
Häufige Fragen
Sind die Token-Preise 2026 gestiegen? Die Listenpreise im unteren Segment sind gefallen, aber es sind Stufen und Aufschläge hinzugekommen, die die effektiven Kosten erhöhen: langer Kontext, Datenresidenz und schneller Modus. Dazu kommt die von Google für den 1. Januar 2027 angekündigte Erhöhung um etwa das Doppelte.
Was ist die Long-Context-Stufe? Ein anderer Preis je Token, sobald die Anfrage eine bestimmte Größe überschreitet. Bei Gemini 3.1 Pro liegt die Schwelle bei 200.000 Token, und die Eingabe steigt von 2 $ auf 4 $. OpenAI veröffentlicht beide Stufen, aber nicht die Schwelle dazwischen.
Woran erkenne ich, ob es mich betrifft? Sehen Sie sich die Kosten je Million Token Monat für Monat an, getrennt nach Modell und Pfad. Steigen sie, ohne dass Sie das Modell gewechselt haben, ist die Ursache meist eine Stufe oder ein Aufschlag, nicht der Anbieter.
Dieser Beitrag gehört zum Cluster über die KI-Kosten je Aufgabe. Wenn Sie Ihre eigenen Zahlen einsetzen wollen, gibt es den Token-Kostenrechner.
Preise geprüft am 7. September 2026 auf den offiziellen Seiten von OpenAI, Anthropic und Google. Sie ändern sich häufig: Prüfen Sie vor einer Entscheidung immer den geltenden Tarif.
Bei e-ficient messen wir die Kosten je Aufgabe von Unternehmen, die KI bereits produktiv einsetzen. Das Erstaudit ist kostenfrei, wenn Sie einen Plan mit drei Monaten Laufzeit abschließen, und liefert binnen 72 Stunden eine Diagnose.