← Alle Beiträge

Das Mooresche Gesetz für KI ist offiziell tot

Auf dieser Seite

Google hat heute Gemini 3 Flash veröffentlicht. Es ist das neue Standardmodell in der Gemini-App, weltweit, und ersetzt Gemini 2.5 Flash.1 Die Benchmarks sehen beeindruckend aus: Es schlägt Gemini 2.5 Pro und ist dreimal so schnell.

Aber es gibt einen Haken. Es ist teurer.

Eingabe-Token sprangen von $0,30 auf $0,50 pro Million. Ausgabe-Token von $2,50 auf $3,00. Das sind 67% mehr bei der Eingabe und 20% mehr bei der Ausgabe.

Die Kommentare auf Hacker News haben es schon gemerkt:

They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2

Seit Jahren erzählt man uns, KI werde billiger. Das Mooresche Gesetz für Inferenz. Wettlauf nach unten. Aber passiert das wirklich?

Gilt das für den ganzen Markt?

Kurze Antwort: Es kommt darauf an, welche Modelle du dir ansiehst.

Ich habe die letzten Tage historische Preisdaten aller großen Anbieter zusammengetragen: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek und Cohere.3 Das Bild ist differenzierter als die Erzählung von der “immer billigeren KI”.

Wir erleben eine K-förmige Erholung bei den KI-Preisen.

Falls dir der Begriff nichts sagt: Ein “K-förmiger” Verlauf entsteht, wenn sich Teile des Marktes in entgegengesetzte Richtungen bewegen. Ein Arm des K schießt nach oben, der andere stürzt ab. Bei KI spaltet sich der Preis für rohe Intelligenz auf. Manche Anbieter von Massenware liefern sich weiter ein Rennen nach unten, aber die Modelle, auf die wir uns für ernsthafte Arbeit verlassen, werden immer teurer. Ehrlich gesagt sieht es weniger nach einem K aus als nach einem <: ein Krokodil mit weit aufgerissenem Maul, das gleich einen KI-Gründer verspeist.

Ich zeige dir, was ich gefunden habe.

Preise der Frontier-Modelle im Zeitverlauf

Zuerst die Frontier-Modelle. Das sind die besten, die jeder Anbieter zu bieten hat, die Spitzenreiter der Forschung, die an der Grenze des Machbaren rechnen. Du nimmst sie für komplexes Schlussfolgern, agentische Workflows und Aufgaben, bei denen Qualität wichtiger ist als der Preis.

Eingabepreise ($ pro 1 Mio. Token)

Ausgabepreise ($ pro 1 Mio. Token)

Die Geschichte der Frontier-Modelle ist unübersichtlich. Der Boden steigt. Während wir die Preissenkungen von 80% im Jahr 2024 gefeiert haben, kommen die Frontier-Modelle von 2025 mit Aufschlag. Wir zahlen nicht nur für mehr Intelligenz. Wir zahlen für die gewaltigen Forschungs- und Energierechnungen, die jetzt endlich fällig werden.

OpenAI hat die Preise für GPT-4 in 18 Monaten um 83% gesenkt,4 doch mit GPT-5 und Spezialmodellen wie o1-pro dreht sich der Trend um. Anthropic hielt Claude Opus fast zwei Jahre bei $15/$75 und senkte Opus 4.5 dann um 67%.5 Google hat Gemini 1.5 Pro Ende 2024 massiv verbilligt und die Preise für Gemini 3 Pro dann wieder angehoben.

Das Einzige, was die Erzählung vom “Wettlauf nach unten” noch am Leben hält? DeepSeek. Ihr V3 kostet $0,28/$1,10, ist 18-mal billiger als GPT-5 und 54-mal billiger als Claude Opus auf seinem Höhepunkt. DeepSeek ist der Spielverderber. Der Beweis, dass Effizienzgewinne möglich sind, aber auch ein Ausreißer, den die westlichen Labore nicht erreicht haben.

Preise der Effizienz-Modelle im Zeitverlauf

Bei den Effizienz-Modellen, den Arbeitspferden für hohe Volumen in der Produktion, fällt die Spreizung noch deutlicher aus.

Eingabepreise ($ pro 1 Mio. Token)

Ausgabepreise ($ pro 1 Mio. Token)

Hier wird es interessant.

Die schnelle Stufe von OpenAI wurde um 92% billiger, von GPT-3.5 Turbo ($2/$2) auf GPT-4o mini ($0,15/$0,60). Das ist die Erzählung, die man uns auftischt.

Aber sieh dir Anthropic an. Claude 3 Haiku startete im März 2024 bei $0,25/$1,25. Dann kam Claude 3.5 Haiku im November 2024 mit $1,00/$5,00.6 Das ist eine 4-fache Preiserhöhung für das “Budget”-Modell.

Und Google? Gemini 1.5 Flash fiel im August 2024 auf $0,075/$0,30. Das heutige Gemini 3 Flash? $0,50/$3,00. Das ist ein 6,7-facher Anstieg bei der Eingabe und ein 10-facher bei der Ausgabe.

Der Trend bei den Effizienz-Modellen zeigt nicht durchgehend nach unten. Es hängt ganz davon ab, welchen Anbieter du nutzt.

Stehen dem echte Verbesserungen gegenüber?

Berechtigte Frage. Vielleicht steigen die Preise ja, weil die Modelle dramatisch besser werden?

MMLU-Werte im Zeitverlauf

HumanEval-Werte im Zeitverlauf (Coding)

Die Benchmarks erzählen eine differenzierte Geschichte.

Die MMLU-Werte der Spitzenmodelle liegen dicht beieinander, bei 88-92%.7 GPT-4 erreichte im März 2023 86,4%. GPT-5 erreicht heute 91,4%. Das sind 5,8 Prozentpunkte in knapp drei Jahren. Der Abstand zwischen den Anbietern ist auf wenige Punkte geschrumpft.

HumanEval zeigt dramatischere Zuwächse, von 67% auf über 92% bei den Führenden. Aber auch hier rücken die Spitzenmodelle zusammen.

Die unbequeme Wahrheit: Die Benchmark-Verbesserungen haben sich verlangsamt, während manche Preise steigen. Die Kurve aus Preis und Leistung ist nicht mehr so günstig wie 2023-2024.

Was treibt diese Preiserhöhungen?

Wir haben eine Effizienzgrenze bei der Inferenz erreicht.

Die leichten Gewinne sind abgeräumt: KV-Caching, Quantisierung, architektonische Feinarbeit. Für den nächsten Sprung beim Schlussfolgern werfen wir jetzt rohe Rechenleistung auf das Problem, während der Inferenz, über interne “Chain of Thought”-Schleifen. Du kannst dich nicht aus einem Modell herausoptimieren, das 10 Sekunden “nachdenken” muss, bevor es antwortet.

Weitere Faktoren:

  • Energiekosten. Rechenzentren konkurrieren weltweit um knappe Stromkapazität. Google, Microsoft und Amazon schließen langfristige Stromabnahmeverträge über Milliarden.
  • Kapitalrendite. Hyperscaler, die jährlich $50-100 Mrd. in Infrastruktur stecken, müssen Investoren jetzt Profitabilität zeigen. Die Phase des Landgrabs ist vorbei.
  • Datenlizenzen. Die Zeit kostenloser Trainingsdaten geht zu Ende. Unternehmen zahlen Millionen für hochwertige menschliche Texte.

Der Folgeeffekt: “Unbegrenzt” ist tot

Wenn die Preise der Modelle steigen, was passiert dann mit den Produkten, die darauf aufbauen?

Wir sehen einen allgemeinen Wechsel zu nutzungsbasierten Preisen.

Cursor stellte im Juni 2025 auf nutzungsbasierte Credits um.8 Als Claude Opus 4 bei $15/$75 blieb, wurde Cursors Pauschaltarif “Pro” zum Wohltätigkeitsprojekt. Der Schritt war keine Wahl, sondern eine Überlebensmaßnahme.9 Heavy User zahlen jetzt $100-200 pro Monat.

GitHub Copilot führte “Premium Requests” ein und setzte im Juni 2025 Limits durch.10 Am 2. Dezember 2025 strich GitHub die alten $0-Budgets, mit denen viele Enterprise-Konten Mehrkosten abgeblockt hatten.11 Wenn du deine Copilot-Abrechnungseinstellungen länger nicht geprüft hast, kann dich eine Überraschung erwarten.

Lovable wechselte im Juli 2025 zu komplexitätsbasierten Abzügen.12 In der Dokumentation steht jetzt die Warnung: “If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned.”

Das Muster ist eindeutig. Jedes große KI-Entwicklertool ist von “unbegrenzten” Festpreisen auf Verbrauchsmodelle umgestiegen oder dabei, es zu tun. Das ist keine Gier. Die zugrunde liegende Ökonomie holt die Preise ein.

Und was ist mit Quanten?

Es hat eine gewisse Ironie, dass Google, das Unternehmen, das die Preise für Gemini Flash gerade um das 10-Fache angehoben hat, vielleicht auch den Schlüssel in der Hand hält, KI wieder bezahlbar zu machen.

Der Quantenprozessor Willow und der Algorithmus “Quantum Echoes” sollen Supercomputer um das 13.000-Fache übertreffen.1314 Das Versprechen: Quantenhardware könnte die Matrixmultiplikationen revolutionieren, die Inferenz in neuronalen Netzen so teuer machen.

Aber bleiben wir ehrlich.

Google verlangt von uns, auf eine Quantenzukunft im Multiversum zu wetten, um ein Preisproblem zu lösen, das es in der Gegenwart selbst geschaffen hat.15 Ein klassisches Ablenkungsmanöver. Solange ich Willow nicht für $0,01 pro 1 Mio. Token an eine Produktions-API hängen kann, ist das nur PR mit Physik-Aroma.

Dies ist das Unternehmen, das 293 Produkte eingestampft hat.16 Selbst wenn Quanteninferenz machbar wird, legt die Bilanz nahe, dass Google einen Weg fände, sie teuer zu machen, an die eigene Cloud zu ketten oder gleich ganz aufzugeben.

Die Preislandschaft der KI ist keine einfache Geschichte sinkender Kosten mehr. Es ist eine K-förmige Spaltung, in der Frontier-Intelligenz und verlässliche Arbeitspferde teurer werden. Wenn du deine KI-Ausgaben nicht kleinteilig im Blick hast, erlebst du eine Überraschung, sobald die Rechnung kommt.

Wenn dich das anspricht, ist vielleicht der Zeitpunkt für ein Gespräch mit flowstate.


Ein Großteil der Recherche entstand mit Hilfe des Internet Archive. Für weite Teile dieses Beitrags musste ich ältere Versionen von Websites durchstöbern. Wenn dir die Mission des Internet Archive gefällt, digitale Geschichte zu bewahren, unterstütze es mit einer Spende.

Footnotes

  1. Google Gemini 3 Flash announcement (Dezember 2025) ↩

  2. Hacker News discussion on Gemini 3 Flash (Dezember 2025) ↩

  3. Preisdaten aus der offiziellen Dokumentation zusammengestellt: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩

  4. OpenAI API Pricing, historische Preise über die Wayback Machine ↩

  5. Anthropic Claude Pricing ↩

  6. Claude 3.5 Haiku announcement (November 2024) ↩

  7. Stanford HAI: 2025 AI Index Report ↩

  8. Cursor pricing changes (Juni 2025) ↩

  9. TechCrunch: Cursor apologizes for unclear pricing changes ↩

  10. GitHub Copilot premium requests documentation ↩

  11. GitHub Copilot billing changes (Dezember 2025) ↩

  12. Lovable pricing and credits ↩

  13. Google Willow quantum chip announcement (Dezember 2024) ↩

  14. Google Quantum Echoes demonstration, Nature (Oktober 2025) ↩

  15. Hartmut Neven, Gründer von Google Quantum AI, über Willow und die Multiversum-Hypothese ↩

  16. Killed by Google, der Google-Friedhof ↩