Nur 11 Prozent treffen ihr KI-Budget: Warum das günstigere Modell oft teurer ist

89 Prozent der Firmen verfehlen ihre KI-Kostenplanung, und in jedem dritten Vergleich kostet das billigere Modell mehr. Wie Budgets planbar werden.

Hände halten einen weißen Taschenrechner über einer Firmenrechnung und einem Diagramm

KI wird pro Token immer billiger, die Rechnungen der Unternehmen werden trotzdem kaum vorhersehbar. Das Wall Street Journal hat am 5. Oktober 2026 zwei Studien zusammengeführt, die das Problem von zwei Seiten zeigen: Eine Umfrage unter knapp 400 Organisationen ergab, dass nur 11 Prozent ihre KI-Ausgaben verlässlich planen können. Und eine Untersuchung von Forschenden aus Stanford, Berkeley, Carnegie Mellon und Microsoft Research zeigt, dass der Listenpreis eines Modells wenig darüber aussagt, was eine Aufgabe am Ende kostet.

89 Prozent verfehlen ihre Planung

Die erste Zahl stammt aus dem State of AI Cost Governance Report 2026 des Softwareanbieters Mavvrik und des Analysehauses Benchmarkit, veröffentlicht Ende Juli. Befragt wurden im April und Mai 396 Organisationen aus sechs Branchen. Nur 11 Prozent trafen ihre KI-Ausgaben auf zehn Prozent genau, 89 Prozent lagen weiter daneben.

Die Folgen reichen bis in die Unternehmensführung. 62 Prozent sagen, unerwartete KI-Kosten hätten eine Geschäftsentscheidung verändert. 40 Prozent mussten das Thema bis in Vorstand oder Aufsichtsrat tragen, 33 Prozent verhängten einen Ausgabenstopp, 25 Prozent verschoben oder stoppten Projekte. Interessant ist, wo die Überraschungen herkamen: Am häufigsten nannten die Befragten Mehrkosten bei Datenplattformen (47 Prozent), erst danach die Token-Kosten selbst (43 Prozent). 39 Prozent sagen, KI-Assistenten fürs Programmieren kosten mehr als erwartet.

Einschränkend gilt: Mavvrik verkauft Software, die genau dieses Problem lösen soll. Die Richtung der Ergebnisse deckt sich aber mit anderen Erhebungen. Gartner hatte bereits im September gemeldet, dass 11 Prozent der befragten Organisationen nicht einmal wussten, wie viel ihre Abteilung 2025 für KI ausgegeben hatte.

Wenn das billigere Modell mehr kostet

Die zweite Zahl stammt aus dem Fachaufsatz The Price Reversal Phenomenon, dessen überarbeitete Fassung im Mai erschienen ist. Die Forschenden ließen acht Reasoning-Modelle, darunter GPT-5.4, Gemini 3 Flash, Claude Opus 4.7, Claude Haiku 4.5 und Kimi K2.6, 6.877 Aufgaben aus zwölf Testreihen lösen. Das Ergebnis: In 32 Prozent der Modellvergleiche war das Modell mit dem niedrigeren Listenpreis insgesamt teurer, im Extremfall um das 28-Fache.

Ein Beispiel aus der Studie: Gemini 3 Flash ist nach Liste rund 80 Prozent günstiger als GPT-5.4. Über alle Aufgaben kostete es aber 705 US-Dollar, GPT-5.4 nur 509 US-Dollar. Der Grund sind die Denk-Token, die ein Modell vor der eigentlichen Antwort erzeugt und die voll abgerechnet werden. Bei einer einzelnen Aufgabe brauchte Gemini 3 Flash mehr als 60.000 solcher Token, GPT-5.4 nur 25. Bei Agenten kommt hinzu, dass manche Modelle bis zu zehnmal mehr Arbeitsschritte für dasselbe Ziel brauchen.

Price alone should not be used to infer which model is actually cheaper.

So fasst Erstautor Lingjiao Chen das Ergebnis gegenüber PYMNTS zusammen. Dazu kommt eine zweite, unbequeme Erkenntnis: Stellt man dieselbe Anfrage mehrmals, schwankt die Zahl der Denk-Token um bis zu den Faktor 9,7. Die Kosten einer einzelnen Anfrage lassen sich nach Ansicht der Autoren deshalb grundsätzlich nicht genau vorhersagen.

Taschenrechner, Notizblock und Geldscheine auf einem hellen Schreibtisch

Billiger pro Token, teurer pro Aufgabe

Beide Befunde passen zu einer Entwicklung, die sich seit Monaten abzeichnet. Die Preise pro Token fallen, der Verbrauch steigt. Nach dem Ramp AI Index, über den The Decoder am 2. Oktober berichtete, nutzen US-Firmen seit Juli rund 50 Prozent mehr KI, während ihre Ausgaben sinken, vor allem dank Preissenkungen bei OpenAI und Anthropic. Gleichzeitig werden Agenten-Abläufe länger und verbrauchen mehr Token pro erledigter Aufgabe. Accenture kommt in einer eigenen Erhebung zu dem Schluss, dass 54 Prozent der Anfragen an leistungsstärkere und damit teurere Modelle gehen als nötig.

Auch die Anbieter reagieren. Microsoft stellt neue Copilot-Business-Lizenzen über Partner ab dem 1. Dezember 2026 auf eine nutzungsabhängige Abrechnung mit einem voreingestellten Limit von 4.000 Copilot Credits pro Nutzer und Monat um. Deutschland ist davon vorerst ausgenommen, die Richtung ist aber klar: Pauschalen werden zu Verbrauchsrechnungen.

Wie KI-Kosten planbar werden

Die gute Nachricht: Unplanbar sind die Kosten nicht, man muss nur anders messen. Entscheidend ist nicht der Preis pro Million Token, sondern der Preis pro erledigter Aufgabe. Den bekommt man nur durch einen Test mit eigenen, typischen Aufgaben und mehreren Modellen.

Danach helfen technische Leitplanken. Ein zentrales Gateway, über das alle KI-Anfragen laufen, zeigt Verbrauch pro Anwendung und Abteilung. Ausgabenlimits beim Anbieter verhindern Überraschungen am Monatsende. Viele Modelle erlauben inzwischen, den Denkaufwand festzulegen, wie wir es bei Claude Sonnet 5.5 beschrieben haben. Wer ihn bewusst setzt, statt der Voreinstellung zu vertrauen, begrenzt die teuren Denk-Token. Und nicht jede Aufgabe braucht das stärkste Modell: Einfache Klassifizierungen oder Zusammenfassungen kann ein kleineres Modell übernehmen.

Ein anderer Weg ist der Selbstbetrieb. Mit Kolibri hat Aleph Alpha am 3. Oktober ein offenes Modell veröffentlicht, das ausdrücklich für das eigene Rechenzentrum gedacht ist. Wer ein Modell auf eigener oder fest gemieteter Hardware betreibt, zahlt einen festen Betrag statt pro Token. Das macht das Budget planbar, aber nicht automatisch kleiner: Hardware, Strom und Betreuung kosten auch, und die Speicherpreise steigen gerade.

Was das für Ihr Unternehmen heißt

  • Listenpreise sind für die Modellwahl wenig aussagekräftig. Vergleichen Sie die Kosten pro erledigter Aufgabe mit Ihren eigenen Anwendungsfällen.
  • Legen Sie Ausgabenlimits beim Anbieter fest und lassen Sie alle KI-Anfragen über eine zentrale Stelle laufen, die den Verbrauch pro Anwendung sichtbar macht.
  • Setzen Sie den Denkaufwand der Modelle bewusst und prüfen Sie, welche Aufgaben ein kleineres Modell erledigen kann.
  • Planen Sie Puffer ein. Selbst bei gleicher Anfrage schwanken die Kosten, eine Punktlandung ist bei nutzungsabhängiger Abrechnung kaum möglich.
  • Rechnen Sie bei hohem, gleichmäßigem Verbrauch oder sensiblen Daten den Selbstbetrieb eines offenen Modells gegen. Feste Kosten sind leichter zu planen als Token-Rechnungen.
Richard von Rüden
Über den Autor Richard von Rüden Senior Entwickler & AI Engineer

Seit über 15 Jahren entwickle ich Websites und Apps und beschäftige mich intensiv mit KI-Automatisierung sowie Datenschutz. In meinen Artikeln teile ich aktuelle News, fundiertes Fachwissen und Erfahrungen aus zahlreichen Projekten.

Kostenlose Beratung
← Zurück zu den News