← Alle berichten

Ontsnappen aan de AI-kostenval

Op deze pagina

Ik heb lang niets geschreven. Ik neem twee weken vrij in het zuiden van Frankrijk, met familie en vrienden. Onze discussies aan tafel gaan steeds weer over AI: de complexiteit, het potentieel en de enorme problemen met de financiering.

AI is voor eindgebruikers op dit moment goedkoop, maar alleen omdat durfkapitaal de rekening betaalt. Training en inferentie zijn nog steeds duur en iemand moet dat betalen. Nu zijn dat de investeerders. Maar de prijzen blijven niet eeuwig laag. De som klopt gewoon niet.

Subsidies houden het niet vol

De miljarden die OpenAI, Anthropic, Mistral en anderen hebben opgehaald gaan op aan rekenkracht, personeel en Nvidia-GPU’s. Consumenten zien gesubsidieerde prijzen, maar de kosten eronder zijn enorm. De geldstroom ziet er ongeveer zo uit:

  1. VC’s / private investeerders pompen miljarden in de modelaanbieders.
  2. Modelaanbieders (OpenAI, Anthropic, Mistral) geven daarna veel uit aan cloudtegoed.
  3. Cloudaanbieders (Microsoft, Amazon, Google) geven die uitgaven door aan hun infrastructuur.
  4. Die infrastructuur komt uiteindelijk neer op GPU’s, datacenters, stroom en personeel.
  5. Nvidia boekt recordkwartalen en is de echte winnaar.

Een mooi kleinschalig trickle-down-ketentje. Alleen tilt hier niet de vloed alle boten op, maar de beurskoers van Nvidia. De overeenkomst met de beginjaren van de taxiapps (bijvoorbeeld Uber) is griezelig: de groei komt van goedkoop kapitaal, niet van gezonde eenheidskosten12.

Twee strategieën: Howie en Jamie

Sommige concurrenten van mijn product Jamie, zoals Howie, leunen op menselijke controle. Volgens een recente podcast hebben ze 60+ mensen in dienst die simulatieresultaten met de hand nakijken. Zo borg je de kwaliteit, maar het roept vragen op over schaalbaarheid.

Met Jamie kiezen we een andere weg. Vandaag draaien we in productie op Claude Sonnet 4 en GPT-5. Sonnet is ons hoofdmodel (al is het soms vervelend onbetrouwbaar), GPT-5 is de terugvaloptie. Beide leveren sterke resultaten.

Maar we leggen het vertrouwen niet bij mensen neer. We laten meerdere modellen parallel draaien om resultaten te controleren en draaien opnieuw tot het antwoord betrouwbaar is. We vertrouwen op de modellen en op onze klanten, die zo nodig corrigeren, in plaats van het vertrouwen uit te besteden aan een groot team voor handmatige controle.

We leggen ook metadata van elke uitwisseling vast. Die fragmenten halen we later weer boven en weven we in de context om antwoorden te verrijken. De assistent onthoudt zo niet alleen feiten, maar kan ook nuance hergebruiken, zoals hints over de tijdzone of terloopse details, om de best mogelijke antwoorden te geven.

Wie hier echt aan verdient

Of je nu Howie bent, Jamie of een modelaanbieder: het geld stroomt altijd dezelfde kant op.

VC-dollars → modelaanbieders → cloudaanbieders → GPU’s, datacenters en talent.

Nvidia domineert, met tot wel 95% van de markt voor AI-GPU’s3. Elke dollar van elke startup komt uiteindelijk in hun kwartaalcijfers terecht.

Je basislast zelf in bezit hebben

Dit is de strategische zet: bezit je basislast en schaal op naar de cloud als het moet.

  • Basislast qua rekenkracht: Langlevende hardware in een colocatie of zelfs op kantoor. Afgeschreven over 3–5 jaar levert dat een stabiele, voorspelbare kostenbasis op. AI-workloads hebben vaak geen supersnelle SSD’s nodig. GPU-cycli zijn de bottleneck.
  • Rekenkracht voor pieken: De cloud voor pieken, experimenten en elasticiteit.

Deze hybride aanpak beschermt je tegen stijgende cloudprijzen voor inferentie en laat je flexibel waar dat telt.

Waarom we weer naar hardware kijken

Open source heeft de som veranderd. Meta’s LLaMA 3 scoort in benchmarks dicht bij GPT-5, en we hebben LLaMA en Mistral rechtstreeks getest tegen onze Claude- en GPT-5-resultaten. Ze presteren net zo goed45. Dat is een duidelijke uitweg.

Op een Mac Studio (M2 Ultra, 192 GB RAM, 1 TB SSD) draait LLaMA-inferentie op bruikbare snelheid. Zet er 20 in een kantoor en je hebt serieuze, aanhoudende doorvoer voor een fractie van de kosten van cloudinferentie.


Snelle kostenvergelijking: Mac Studio tegenover OpenAI

Mac Studio (M2 Ultra, 192 GB RAM, 1 TB SSD)

  • Kosten per stuk (2025): ≈$7.000 USD (≈£5.400)
  • 20 stuks: ≈$140.000 USD (≈£109.000)
  • Levensduur: ~2–3 jaar (voorzichtig voor ML-workloads)6

Vergelijkbare uitgaven bij OpenAI/Anthropic

  • GPT-5-prijzen (sept. 2025): $1,25 per miljoen tokens input, $10 per miljoen tokens output7
  • Claude Sonnet 4-prijzen: $3 per miljoen tokens input, $15 per miljoen tokens output8
  • Een middelgroot product met ~500M tokens per maand (heel bescheiden voor assistenten op schaal) = ≈$14.625/maand bij gebruik van GPT-5 + Claude Sonnet 4
  • 2 jaar = ≈$351.000 (≈£273.000)

Dat is bijna 3x zoveel als het kost om eigen hardware te kopen en te draaien. En het verschil groeit met de schaal.


De waarschijnlijke uitkomst voor ons

Tenzij modellen radicaal efficiënter worden, gaan de prijzen omhoog zodra de VC-subsidies opdrogen. Maar we hebben al laten zien dat open source de resultaten van de frontiermodellen kan evenaren.

Daarom is de waarschijnlijke uitkomst voor ons simpel:

  • Weg van de afhankelijkheid van Claude en GPT-5
  • LLaMA en zelf getrainde of gefinetunede open modellen inzetten
  • Kosten verankeren met basislast-hardware, alleen bij behoefte opschalen naar de cloud

De toekomst van AI is niet alleen weggelegd voor wie het meeste kapitaal heeft. Ze is weggelegd voor wie slimme, efficiënte stacks bouwt.


Footnotes

  1. Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩

  2. Sequoia Capital, Generative AI’s Act Two, 2023. Link ↩

  3. Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩

  4. Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩

  5. Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩

  6. Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩

  7. OpenAI, GPT-5 pricing, 2025. Link ↩

  8. Claude, Claude 4 and Claude Sonnet pricing, 2025. Link ↩