← Alle berichten

De wet van Moore voor AI is officieel dood

Op deze pagina

Google heeft vandaag Gemini 3 Flash uitgebracht. Het is het nieuwe standaardmodel in de Gemini-app, wereldwijd, en vervangt Gemini 2.5 Flash.1 De benchmarks zien er indrukwekkend uit. Het model doet het beter dan Gemini 2.5 Pro en is drie keer zo snel.

Maar er is een addertje. Het is duurder.

De inputtokens gingen van $0,30 naar $0,50 per miljoen. De outputtokens van $2,50 naar $3,00. Dat is 67% meer voor input en 20% meer voor output.

De reacties op Hacker News zitten er al bovenop:

They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2

Jarenlang kregen we te horen dat AI steeds goedkoper wordt. De wet van Moore voor inference. Een race naar de bodem. Maar gebeurt dat echt?

Gebeurt dit overal?

Kort antwoord: dat hangt af van welke modellen je bekijkt.

Ik heb de afgelopen dagen historische prijsdata verzameld van alle grote aanbieders: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek en Cohere.3 Het beeld dat daaruit komt is genuanceerder dan het verhaal dat AI goedkoper wordt.

We zien een K-vormig herstel in AI-prijzen.

Als je de term niet kent: een K-vormige trend ontstaat wanneer delen van de markt in tegengestelde richting bewegen. De ene poot van de K schiet omhoog en de andere stort naar beneden. Bij AI valt de prijs van pure intelligentie uiteen. Een aantal commodity-spelers blijft racen naar de bodem, terwijl de modellen waar we echt op leunen voor serieus werk steeds duurder worden. Eerlijk gezegd lijkt het minder op een K en meer op een <: een krokodil met wijd open bek, klaar om een AI-oprichter op te vreten.

Ik laat zien wat ik vond.

Prijzen van frontier-modellen door de tijd

Eerst de frontier-modellen. Dat is het beste wat elke aanbieder te bieden heeft, de onderzoeksleiders die de grenzen van rekenkracht opzoeken. Die gebruik je voor complexe redenering, agentic workflows en taken waarbij kwaliteit zwaarder weegt dan kosten.

Inputprijzen ($/1M tokens)

Outputprijzen ($/1M tokens)

Het frontier-verhaal is rommelig. De ondergrens stijgt. Terwijl we de prijsdalingen van 80% in 2024 vierden, komen de frontier-modellen van 2025 met een toeslag. We betalen niet alleen voor meer intelligentie. We betalen ook de enorme R&D- en energierekeningen die eindelijk binnenkwamen.

OpenAI verlaagde de prijs van GPT-4 in 18 maanden met 83%,4 maar die trend is gekeerd met GPT-5 en gespecialiseerde varianten zoals o1-pro. Anthropic hield Claude Opus bijna twee jaar op $15/$75 en verlaagde Opus 4.5 daarna met 67%.5 Google sneed eind 2024 flink in de prijs van Gemini 1.5 Pro, om die van Gemini 3 Pro daarna weer op te schroeven.

Wat houdt het verhaal van de “race naar de bodem” nog overeind? DeepSeek. Hun V3 voor $0,28/$1,10 is 18 keer goedkoper dan GPT-5 en 54 keer goedkoper dan Claude Opus op zijn hoogtepunt. Het is de spelbreker. Het bewijs dat efficiëntiewinst mogelijk is, maar ook een uitschieter die de westerse labs niet hebben geëvenaard.

Prijzen van efficiency-modellen door de tijd

Efficiency-modellen, de werkpaarden voor grote volumes in productie, laten een nog scherpere splitsing zien.

Inputprijzen ($/1M tokens)

Outputprijzen ($/1M tokens)

Hier wordt het interessant.

De snelle tier van OpenAI werd 92% goedkoper, van GPT-3.5 Turbo ($2/$2) naar GPT-4o mini ($0,15/$0,60). Dat is het verhaal dat we te horen kregen.

Maar kijk naar Anthropic. Claude 3 Haiku kwam in maart 2024 uit voor $0,25/$1,25. In november 2024 volgde Claude 3.5 Haiku voor $1,00/$5,00.6 Dat is een prijsverhoging van 4x voor het “budgetmodel”.

En Google? Gemini 1.5 Flash zakte in augustus 2024 naar $0,075/$0,30. Het huidige Gemini 3 Flash? $0,50/$3,00. Dat is 6,7x meer voor input en 10x meer voor output.

De trend bij efficiency-modellen wijst niet consequent omlaag. Het hangt volledig af van welke aanbieder je gebruikt.

Zijn de modellen er ook echt beter op geworden?

Terechte vraag. Misschien worden de prijzen hoger omdat de modellen dramatisch beter worden?

MMLU-scores door de tijd

HumanEval-scores door de tijd (coderen)

De benchmarks vertellen een genuanceerd verhaal.

De MMLU-scores van de topmodellen liggen dicht bij elkaar, rond 88-92%.7 GPT-4 haalde in maart 2023 86,4%. GPT-5 haalt vandaag 91,4%. Dat is 5,8 procentpunt in bijna drie jaar. Het verschil tussen aanbieders is geslonken tot een paar punten.

HumanEval laat grotere sprongen zien, van 67% naar 92%+ voor de koplopers. Maar ook hier komen de topmodellen naar elkaar toe.

De ongemakkelijke waarheid: de verbeteringen in benchmarks zijn vertraagd, terwijl sommige prijzen stijgen. De curve van prijs tegenover prestatie is minder gunstig dan in 2023-2024.

Waardoor stijgen de prijzen?

We zijn tegen een plafond in inference-efficiëntie aangelopen.

De laaghangende vruchten zijn geplukt: KV-caching, quantization, aanpassingen aan de architectuur. Voor de volgende stap in redeneren gooien we nu ruwe rekenkracht naar het probleem tijdens de inference, via interne “chain of thought”-iteraties. Je kunt je er niet uit optimaliseren als een model 10 seconden moet “nadenken” voor het antwoord geeft.

Andere factoren:

  • Energiekosten. Datacenters strijden wereldwijd om beperkte stroomcapaciteit. Google, Microsoft en Amazon sluiten langlopende stroomcontracten ter waarde van miljarden.
  • Rendement op kapitaal. Hyperscalers die jaarlijks $50-100B in infrastructuur steken, moeten nu aan investeerders laten zien dat het winstgevend is. De fase van het land inpikken is voorbij.
  • Datalicenties. De tijd van gratis trainingsdata loopt af. Bedrijven betalen miljoenen voor hoogwaardige menselijke tekst.

Het gevolg verderop: “onbeperkt” is dood

Als de prijzen van de modellen stijgen, wat gebeurt er dan met de producten die erop gebouwd zijn?

We zien een algemene overstap naar gebruiksafhankelijke prijzen.

Cursor stapte in juni 2025 over op tegoeden op basis van gebruik.8 Toen Claude Opus 4 op $15/$75 bleef staan, werd het “Pro”-abonnement van Cursor met vast tarief een liefdadigheidsproject. De overstap was geen keuze, maar een overlevingstactiek.9 Zware gebruikers betalen nu $100-200 per maand.

GitHub Copilot voerde “premium requests” in en begon in juni 2025 limieten af te dwingen.10 Op 2 december 2025 schrapten ze de oude budgetten van $0 waarop veel bedrijfsaccounts vertrouwden om extra kosten te blokkeren.11 Heb je je Copilot-facturatie de laatste tijd niet nagekeken, dan kan je een verrassing wachten.

Lovable stapte in juli 2025 over op aftrek op basis van complexiteit.12 In hun documentatie staat nu de waarschuwing: “If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned.”

Het patroon is duidelijk. Elke grote AI-tool voor developers is overgestapt, of is bezig over te stappen, van “onbeperkte” abonnementen met vaste prijs naar verbruiksmodellen. Dat is geen hebzucht. De onderliggende economie haalt ze in.

En quantum dan?

Het is enigszins ironisch dat Google, het bedrijf dat net de prijzen van Gemini Flash 10x omhoog gooide, ook de sleutel kan hebben om AI weer betaalbaar te maken.

Hun Willow-quantumprocessor en het “Quantum Echoes”-algoritme zouden 13.000x sneller zijn dan supercomputers.1314 De belofte is dat quantumhardware de matrixvermenigvuldigingen kan omgooien die neurale netwerken in gebruik zo duur maken.

Maar laten we eerlijk zijn.

Google vraagt ons te wedden op een quantumtoekomst met meerdere universa om een prijsprobleem op te lossen dat ze nu zelf veroorzaken.15 Het is een klassiek afleidingsmanoeuvre. Tot ik Willow in een productie-API kan pluggen voor $0,01/1M tokens, is het PR met een natuurkundig sausje.

Dit is het bedrijf dat 293 producten heeft opgedoekt.16 Zelfs als quantum-inference haalbaar wordt, vinden ze vast een manier om het duur te maken, aan hun cloud te koppelen of helemaal te laten vallen.

Het AI-prijzenlandschap is niet langer een eenvoudig verhaal van dalende kosten. Het is een K-vormige splitsing, waarin frontier-intelligentie en betrouwbare werkpaarden allebei duurder worden. Als je je AI-uitgaven niet tot in detail bijhoudt, krijg je een verrassing als de rekening komt.

Als je dit herkent, is het misschien tijd voor een gesprek met flowstate.


Voor een flink deel van de research heb ik het Internet Archive gebruikt. Voor een groot stuk van dit bericht moest ik oudere versies van websites doorzoeken. Vind je de missie van het Internet Archive om de digitale geschiedenis te bewaren de moeite waard, steun ze dan met een donatie.

Footnotes

  1. Google Gemini 3 Flash announcement (December 2025) ↩

  2. Hacker News discussion on Gemini 3 Flash (December 2025) ↩

  3. Pricing data compiled from official documentation: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩

  4. OpenAI API Pricing - historical pricing via Wayback Machine ↩

  5. Anthropic Claude Pricing ↩

  6. Claude 3.5 Haiku announcement (November 2024) ↩

  7. Stanford HAI: 2025 AI Index Report ↩

  8. Cursor pricing changes (June 2025) ↩

  9. TechCrunch: Cursor apologizes for unclear pricing changes ↩

  10. GitHub Copilot premium requests documentation ↩

  11. GitHub Copilot billing changes (December 2025) ↩

  12. Lovable pricing and credits ↩

  13. Google Willow quantum chip announcement (December 2024) ↩

  14. Google Quantum Echoes demonstration - Nature (October 2025) ↩

  15. Hartmut Neven, founder of Google Quantum AI, on Willow and the multiverse hypothesis ↩

  16. Killed by Google - the Google graveyard ↩