← Alle berichten

Verander een AI-rekening van $3 miljoen in $1,9 miljoen

Op deze pagina

Op dit moment gebruikt iemand in jouw team het duurste AI-model om een slidedeck te bewerken. Die persoon heeft dat niet gekozen. Het staat gewoon standaard zo. Herhaal die onzichtbare keuze een paar duizend keer per dag en je AI-rekening begint al snel op een salarisadministratie te lijken.

Twee dingen blazen dat bedrag op. Het standaardmodel past niet bij de taak: je betaalt vlaggenschipprijzen voor werk dat een goedkoper model prima aankan. En de taak is onzichtbaar op de factuur, een enkel totaalbedrag zonder dat je kunt zien op welk project of welk model het is uitgegeven.

Flowstate zit in het verzoekpad om beide lekken te dichten. We sturen elke prompt naar het model dat de taak echt nodig heeft en koppelen elke dollar aan het werk waarvoor hij is uitgegeven. Niemand levert minder op: dezelfde output die je $3 miljoen kostte, kost nu $1,9 miljoen, en voor het eerst zie je welk werk het geld echt heeft gekocht.

Je betaalt Opus-prijzen voor Sonnet-werk

Bijna niemand kiest een model. Mensen gebruiken wat er geselecteerd staat als het invoerveld laadt, en de standaard is het vlaggenschip: het duurste model dat er is. Dat is de juiste keuze voor een echt lastig probleem en pure verspilling voor een mail van één regel. Je kunt van een marketeer niet verwachten dat die weet dat zijn standaard chatvenster vijf keer meer kost dan nodig. De prijs staat niet in beeld en de leverancier heeft geen reden om hem te laten zien.

Laat ze het dus niet hoeven leren. De taak moet het model kiezen, niet de persoon die typt, en die beslissing hoort in de verzoeklaag en niet in iemands hoofd. Een samenvatting of een herformattering gaat naar Haiku, gewoon coderen en schrijven naar Sonnet, het echt zware redeneerwerk naar Opus. Je kunt zelfs één klus splitsen: plannen in Opus en de uitvoering op Sonnet draaien, zodat het dure denkwerk bewaard blijft voor de stappen die het nodig hebben. Wat iemand de hele dag ook doet, hij typt dezelfde prompt en krijgt hetzelfde antwoord. De rekening is alleen kleiner. En dit gaat veel verder dan Claude Code: dezelfde standaard staat voor elke chat die je mensen bij sales, operations en marketing openen.

Hoeveel kleiner? Peer-reviewed onderzoek, zoals de Hybrid LLM van Ding et al., laat zien dat je het aantal aanroepen van het dure model met tot 40% kunt verlagen zonder meetbaar kwaliteitsverlies1. Het is gewoon rekenwerk op je modelmix, en het werkt op elke deployment die je legitiem draait.

Dit is de hefboom die meegroeit met het gebruik: hoe harder je team op AI leunt, hoe meer een verkeerd standaardmodel je kost en hoe meer routering teruggeeft. In de calculator hieronder is het het gat tussen je vette lijn en de groene.

De rekening die je niet ziet

Het is dag één. Een engineer komt bij een bedrijf, krijgt een Enterprise Claude-account en verbrandt in zijn eerste vijf prompts $145. Op een plan met een vast tarief had dat gebruik de hele week geduurd. Op een metered Enterprise-plan is het voor de lunch op. HR stelt al vragen die hij niet kan beantwoorden en hij rekent uit wat een maand van $5.000 is: “meer dan mijn salaris.” Waar de gebruikerspagina een limiet zou moeten tonen, staat één woord: Unlimited. Dat is een echte post van r/ClaudeCode, en het is het tweede lek in één screenshot.

Het eerste lek was het model dat niemand koos. Dit is het andere: de meter waar niemand naar kijkt. Sinds dit jaar rekent Enterprise elke token die je team verbruikt in chat, Claude Code en Cowork af tegen standaard API-tarieven, bovenop de seat2. (Teams houdt een vaste seat met een inbegrepen tegoed.) Metered prijzen zijn goedkoop voor een klein team, maar lopen op schaal uit de hand, en omdat ze op één ongedifferentieerde factuur landen, ziet niemand de piek tot financiën aan de bel trekt. Je kunt niet routeren wat je niet ziet en je kunt niet kiezen tussen twee deployments die je nooit hebt vergeleken. Dus vergelijk ze:

Kies je deur. Bepaal de teamgrootte. Sleep het gebruik.

Jaarlijkse AI-kosten voor je gekozen uitrol (vet), dezelfde uitrol met Flowstate-routing en de andere deuren ter vergelijking. Het gat tot de groene lijn is wat routing je bespaart. Het gat tot de goedkoopste gestippelde lijn is wat de deur je kost.

Claude for Enterprise, vandaag
$ 3,26 mln/jaar
jouw keuze, zonder routing
+ Flowstate-routing
$ 1,89 mln/jaar
bespaart $ 1,38 mln (42%)
Goedkoopste deur: Teams (Premium)
$ 2,35 mln/jaar
$ 915k minder dan jouw deur
$ 0$ 2,63 mln$ 5,25 mln$ 7,88 mln$ 10,50 mln0M250M500M750M1000Mtokens per teamlid / maand
Claude for Enterprise, vandaagClaude for Enterprise + FlowstateClaude for Teams (Premium)
375M

Kijk wat er gebeurt als je sleept. Bij weinig gebruik verschillen de twee deuren nauwelijks, en Enterprise is eigenlijk de goedkopere. Daarom doet dit er niet toe voor een klein team. Schroef het gebruik op en de metered lijn loopt weg. Routering haalt er een derde tot de helft meteen vanaf, en aan de bovenkant begint zelfs overstappen naar een vaste Teams-seat te winnen. Maar je kunt alleen een van beide stappen zetten als je de rekening duidelijk genoeg ziet om te vergelijken, en dat zien de meeste teams niet.

Welke projecten zich echt terugbetaalden

Routering lost op wat je per taak betaalt. De moeilijkere vraag is wat je ermee hebt gekocht, en dat kun je helemaal niet van de factuur aflezen. Kosten zijn maar de helft waar mensen over twisten. Toerekening is de helft die stilletjes meer kost.

Als iemand deze maand $300 aan Opus uitgeeft, is de vraag niet welk model maar welk project. Als je dat niet kunt beantwoorden, belandt elke dollar in dezelfde ongedifferentieerde OpEx-bak en wordt hij direct ten laste van het resultaat gebracht. Financiën ziet een afschrijving van Anthropic en een bedrag, kan het niet aan een persoon of een stuk werk koppelen en kan er dus niets mee behalve toekijken hoe het groeit. Het is een tweede salarisadministratie zonder kostenplaatsen.

Een rekening zonder context is gewoon een rekening, een getal dat omhoog ging. Met context wordt het een kaart. Je ziet dat het team dat de nieuwe betaalflow bouwt $40k per maand aan modeltijd verbrandt, terwijl een experiment dat niemand heeft goedgekeurd er $60k doorheen jaagt. Je ziet welke features meer kosten om te leveren dan ze ooit opbrengen, en welke goedkope features stilletjes de roadmap dragen. Dat is geen kostenbesparing. Het is weten waar je hefboom zit, welk werk je moet voeden en welk je moet laten verhongeren. Toegerekende uitgaven zijn niet langer het getal waar financiën tegenop ziet, maar de scherpste aanwijzing die je hebt over waar echt waarde ontstaat.

En het verandert de boekhouding zelf, niet alleen de rapportage ervan. AI-uitgaven die naar het bouwen van nieuwe software gaan, kun je activeren en afschrijven over de gebruiksduur, net als traditionele softwareontwikkeling onder IAS 38 of ASC 350-403. Het probleem waren nooit de boekhoudregels. Het was het gebrek aan toerekening. Je kunt niet activeren wat je niet kunt toerekenen, en de factuur van de aanbieder rekent niets toe. Flowstate koppelt elke aanroep aan een persoon, een project, een model en een kostenklasse, zodat het werk dat echte waarde bouwt niet meer wegduikt in OpEx.

Hoe meer van je werk in aanmerking komt, hoe groter dit wordt. Als 70% van je ontwikkelinspanning echt nieuw product bouwt (en voor veel teams is dat zo), schuift toerekening het grootste deel van die AI-uitgaven van de winst-en-verliesrekening van dit kwartaal naar de balans, om afgeschreven te worden over de jaren dat de software opbrengt. Bij een AI-rekening van zeven cijfers is dat geen huishoudelijk klusje. Het is het verschil tussen een margeklap nu en een actief dat je later terugverdient. (Of een bepaald project in aanmerking komt, is een oordeel voor je financiële en auditteam, niet voor een blogpost.)

Waar wij in passen

Flowstate is een slimme proxy: denk aan Zscaler, maar dan voor AI-verkeer. We bundelen geen accounts en we beheren je contracten niet. Je houdt je eigen sleutels en je eigen deal met elke aanbieder die je team gebruikt. We zitten in het verzoekpad en doen drie dingen met elke aanroep die erlangs komt: hem routeren naar het model dat de taak echt nodig heeft, hem controleren op dingen die nooit naar buiten mogen (broncode, klant-PII die ergens heen gaat waar het niet hoort) en hem loggen onder een persoon, een project en een kostenklasse. Dat is het inzicht waar Enterprise een toeslag voor rekent, zonder toeslag en zonder dat iemand je contracten in handen krijgt.

Omdat we een proxy zijn en geen accountpool, blijft jouw positie in de voorwaarden van een aanbieder jouw beslissing, genomen met het hele plaatje voor je in plaats van in het donker. Je ziet wat elke deployment echt kost, routeert de uitgaven omlaag en draait de kranen per team open of dicht op basis van hoeveel risico je wilt dragen. De twee lekken hierboven zijn dezelfde machine die twee klussen doet: elk verzoek naar het juiste model sturen en de deployment die je hebt gekozen leesbaar genoeg maken om te beheren.

Een paar kanttekeningen, zonder omwegen. Flowstate maakt een deployment zichtbaar en bestuurbaar. Het herschrijft je contract niet. Als je een BAA nodig hebt, dataresidentie of een contractuele no-trainingsclausule, dan is dat de Enterprise-deur, en daar is onze taak de routering en het grootboek: voorkomen dat de metered rekening uit de hand loopt. En het hele verhaal geldt voor zwaar gebruik: voor een klein team komt de metered rekening nooit in de buurt van het punt waarop dit zich terugbetaalt, zoals de calculator laat zien zodra je het gebruik omlaag sleept.

Jarenlang leek de keuze binair: laat mensen naar elk model grijpen dat voor hun neus staat en slik de rekening, of zet alles op slot en controleer elke prompt met de hand.

Dit hoeft geen binaire keuze te zijn tussen de rekening slikken en je team tot stilstand brengen met gebruikslimieten. Routeer de taak en je betaalt geen Opus-prijzen meer voor Sonnet-werk. Reken de uitgaven toe en AI is niet langer een ongedifferentieerde margeklap. Je hebt alleen een proxy in het midden nodig die je de knoppen geeft.4


Footnotes

  1. Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, meldt tot 40% minder aanroepen van het grote model zonder verlies aan antwoordkwaliteit. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, meldt kostenbesparingen van meer dan 2× op delen van zijn benchmark zonder concessies aan kwaliteit. Routers van leveranciers adverteren hogere cijfers (40–70%). Ik heb gemodelleerd met het peer-reviewed cijfer. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩

  2. Anthropic heeft in 2026 de Enterprise-seatkosten losgekoppeld van tokengebruik. Volgens het Claude Help Center: “Usage isn’t included in the seat fee… Every token your team uses, in chat, Claude Code, or Cowork, is billed at standard API rates on top of your seat cost.” De sessielimieten per seat verschillen per niveau, waarbij een Team Premium-seat ongeveer 6,25× de sessielimiet van Pro heeft. De gepubliceerde basisseats kosten $20 (Team Standard en Enterprise) en $100 (Team Premium). De echte Enterprise-prijs wordt via sales onderhandeld. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩

  3. IAS 38 Intangible Assets (ontwikkelfase) en ASC 350-40 (intern gebruikte software) bepalen wanneer ontwikkelkosten geactiveerd mogen worden in plaats van direct ten laste van het resultaat te komen. Of je in aanmerking komt is een kwestie van oordeel en audit, niet van beweren. Niets hier is boekhoudadvies. ↩

  4. Ik ben medeoprichter van Flowstate, dus de voor de hand liggende melding van een belangenconflict geldt. De routeringscijfers hierboven zijn gemodelleerd op basis van openbare prijzen en het aangehaalde onderzoek, niet op basis van een klantaccount. ↩