Aus einer KI-Rechnung von 3 Mio. $ werden 1,9 Mio. $
Auf dieser Seite
Genau jetzt bearbeitet jemand in deinem Team eine Foliensammlung mit dem teuersten KI-Modell, das es gibt. Er hat es nicht ausgewählt. Es ist einfach der Standard. Wiederhole diese unsichtbare Wahl ein paar tausend Mal am Tag, und deine KI-Rechnung sieht bald aus wie eine Gehaltsabrechnung.
Zwei Dinge blähen die Zahl auf. Das Standardmodell passt nicht zur Aufgabe: Flaggschiffpreise für Arbeit, die ein günstigeres Modell locker erledigen würde. Und die Aufgabe ist auf der Rechnung unsichtbar, eine einzige Summe, aus der du nicht ablesen kannst, für welches Projekt oder welches Modell das Geld draufging.
Flowstate sitzt im Anfragepfad und stopft beide Lecks. Wir leiten jeden Prompt an das Modell weiter, das die Aufgabe wirklich braucht, und ordnen jeden Dollar der Arbeit zu, für die er bezahlt hat. Niemand liefert weniger: Dieselbe Leistung, die dich 3 Mio. $ gekostet hat, kostet jetzt 1,9 Mio. $, und du siehst zum ersten Mal, was das Geld tatsächlich gekauft hat.
Du zahlst Opus-Preise für Sonnet-Arbeit
Fast niemand wählt ein Modell. Alle nehmen, was beim Öffnen des Eingabefelds voreingestellt ist, und das ist das Flaggschiff: das teuerste Modell im Angebot. Für ein wirklich schwieriges Problem ist das richtig. Für eine einzeilige E-Mail ist es reine Verschwendung. Du kannst von einer Marketingfrau nicht erwarten, dass sie weiß, dass ihr Standard-Chatfenster fünfmal mehr kostet als nötig. Der Preis steht nicht auf dem Bildschirm, und der Anbieter hat keinen Anreiz, ihn zu zeigen.
Also bring es ihr gar nicht erst bei. Die Aufgabe sollte das Modell wählen, nicht die Person, die tippt, und diese Entscheidung gehört in die Anfrageschicht statt in irgendeinen Kopf. Eine Zusammenfassung oder eine Umformatierung geht an Haiku, alltägliches Programmieren und Entwerfen an Sonnet, das wirklich harte Denken an Opus. Du kannst sogar eine einzelne Aufgabe aufteilen: Planung in Opus, Ausführung auf Sonnet, und das teure Denken bleibt für die Schritte reserviert, die es brauchen. Die Person tippt, was immer sie den ganzen Tag macht, denselben Prompt und bekommt dieselbe Antwort. Nur die Rechnung ist kleiner. Und das gilt weit über Claude Code hinaus: Derselbe Standard steckt vor jedem Chat, den deine Leute aus Vertrieb, Betrieb und Marketing öffnen.
Wie viel kleiner? Begutachtete Forschung wie das Hybrid LLM von Ding et al. zeigt, dass du Aufrufe des teuren Modells um bis zu 40% senken kannst, ohne messbaren Qualitätsverlust1. Es ist schlicht Arithmetik auf deinem Modellmix, und sie funktioniert bei jedem Einsatzmodell, das du legitim betreibst.
Das ist der Hebel, der mit der Nutzung wächst: Je stärker dein Team auf KI setzt, desto mehr kostet ein falsches Standardmodell, und desto mehr holt das Routing zurück. Im Rechner unten ist das der Abstand zwischen deiner fetten Linie und der grünen.
Die Rechnung, die du nicht siehst
Es ist der erste Tag. Ein Entwickler fängt in einer Firma an, bekommt einen Enterprise-Claude-Account in die Hand gedrückt und verbrennt in seinen ersten fünf Prompts 145 $. In einem Flatrate-Tarif hätte diese Nutzung die ganze Woche gereicht. In einem nutzungsabhängigen Enterprise-Tarif ist sie vor dem Mittagessen weg. Die Personalabteilung stellt schon Fragen, die er nicht beantworten kann, und er rechnet einen Monat mit 5.000 $ hoch: „mehr als mein Gehalt”. Wo die Nutzungsseite ein Limit zeigen sollte, steht ein einziges Wort: Unlimited. Das ist ein echter Post aus r/ClaudeCode, und er zeigt das zweite Leck auf einem einzigen Screenshot.
Das erste Leck war das Modell, das niemand gewählt hat. Das hier ist das andere: der Zähler, den niemand beobachtet. Seit diesem Jahr berechnet Enterprise jedes Token, das dein Team in Chat, Claude Code und Cowork verbraucht, zu Standard-API-Preisen on top auf den Seat2. (Teams behält stattdessen einen festen Seat mit enthaltenem Kontingent.) Nutzungsabhängige Preise sind für ein kleines Team günstig, laufen dir aber im großen Maßstab davon. Und weil sie als eine einzige undifferenzierte Rechnung ankommen, fällt der Ausschlag erst auf, wenn die Finanzabteilung Alarm schlägt. Du kannst nicht routen, was du nicht siehst, und du kannst nicht zwischen zwei Einsatzmodellen wählen, die du nie verglichen hast. Also vergleich sie:
Wähl deine Tür. Bestimm die Teamgröße. Zieh an der Nutzung.
Jährliche KI-Kosten für das gewählte Modell (fett), dasselbe Modell mit Flowstate-Routing und zum Vergleich die anderen Türen. Der Abstand zur grünen Linie ist das, was Routing dir spart. Der Abstand zur günstigsten gestrichelten Linie ist das, was dich die Tür kostet.
Schau, was beim Ziehen passiert. Bei geringer Nutzung unterscheiden sich die beiden Türen kaum, und Enterprise ist sogar die günstigere, weshalb das alles für ein kleines Team keine Rolle spielt. Schieb die Nutzung hoch, und die nutzungsabhängige Linie läuft weg. Routing holt ein Drittel bis die Hälfte direkt wieder herunter, und am oberen Ende gewinnt sogar der Wechsel auf einen festen Teams-Seat. Aber beide Schritte kannst du erst machen, wenn du die Rechnung klar genug siehst, um zu vergleichen, und die meisten Teams können das nicht.
Welche Projekte sich wirklich gelohnt haben
Routing löst, was du pro Aufgabe zahlst. Die schwierigere Frage ist, was du dafür gekauft hast, und das liest du auf der Rechnung gar nicht ab. Die Kosten sind nur die Hälfte, über die alle streiten. Die Zuordnung ist die Hälfte, die stillschweigend mehr kostet.
Wenn jemand diesen Monat 300 $ für Opus ausgibt, lautet die Frage nicht, welches Modell, sondern welches Projekt. Wenn du das nicht beantworten kannst, landet jeder Dollar im selben undifferenzierten OpEx-Topf und wird in dem Moment als Aufwand verbucht, in dem er ausgegeben wird. Die Finanzabteilung sieht eine Abbuchung von Anthropic und eine Zahl, kann sie keiner Person und keiner Arbeit zuordnen und kann deshalb nur zusehen, wie sie wächst. Es ist eine zweite Gehaltsliste ohne Kostenstellen.
Eine Rechnung ohne Kontext ist nur eine Rechnung, eine Zahl, die gestiegen ist. Mit Kontext wird sie zur Landkarte. Du siehst, dass das Team, das den neuen Abrechnungsfluss baut, 40k $ Modellzeit im Monat verbrennt, während ein Experiment, das niemand freigegeben hat, 60k $ verbrennt. Du siehst, welche Features mehr kosten, als sie je einspielen, und welche günstigen die Roadmap still tragen. Das ist kein Kostensparen. Es ist zu wissen, wo dein Hebel liegt, welche Arbeit du füttern und welche du aushungern solltest. Zugeordnete Ausgaben sind nicht mehr die Zahl, vor der die Finanzabteilung sich fürchtet, sondern deine schärfste Auskunft darüber, wo tatsächlich Wert entsteht.
Und es verändert die Buchhaltung selbst, nicht nur ihre Berichte. KI-Ausgaben, die in den Bau neuer Software fließen, lassen sich aktivieren und über die Nutzungsdauer abschreiben, genau wie klassische Softwareentwicklung nach IAS 38 oder ASC 350-403. Das Hindernis waren nie die Bilanzierungsregeln. Es war die fehlende Zuordnung. Du kannst nicht aktivieren, was du nicht zuordnen kannst, und die Rechnung des Anbieters ordnet nichts zu. Flowstate bindet jeden Aufruf an eine Person, ein Projekt, ein Modell und eine Kostenklasse, damit die Arbeit, die echten Wert baut, sich nicht mehr im OpEx versteckt.
Je mehr deiner Arbeit sich qualifiziert, desto größer wird das. Wenn 70% deines Entwicklungsaufwands wirklich neues Produkt bauen (und bei vielen Teams stimmt das), verschiebt die Zuordnung den Großteil dieser KI-Ausgaben aus der GuV dieses Quartals in die Bilanz, abzuschreiben über die Jahre, in denen die Software verdient. Bei einer siebenstelligen KI-Rechnung ist das keine Verwaltungsarbeit. Es ist der Unterschied zwischen einem Margenschlag jetzt und einem Vermögenswert, den du später wieder hereinholst. (Ob ein bestimmtes Projekt sich qualifiziert, beurteilen deine Finanz- und Prüfungsleute, kein Blogpost.)
Wo wir reinpassen
Flowstate ist ein intelligenter Proxy: Stell dir Zscaler vor, aber für KI-Verkehr. Wir bündeln keine Accounts und halten deine Verträge nicht. Du behältst deine eigenen Schlüssel und deinen eigenen Deal mit jedem Anbieter, den dein Team nutzt. Wir sitzen im Anfragepfad und tun bei jedem durchlaufenden Aufruf drei Dinge: ihn an das Modell weiterleiten, das die Aufgabe wirklich braucht, ihn auf Dinge prüfen, die nie das Haus verlassen sollten (Quellcode, personenbezogene Kundendaten auf dem Weg an eine falsche Stelle), und ihn einer Person, einem Projekt und einer Kostenklasse zuordnen. Das ist die Transparenz, für die Enterprise einen Aufpreis verlangt, nur ohne Aufpreis und ohne dass jemand deine Verträge in die Hand bekommt.
Weil wir ein Proxy sind und kein Account-Pool, bleibt es deine Entscheidung, wo du bei den Bedingungen eines Anbieters stehst, getroffen mit dem ganzen Bild vor Augen statt im Dunkeln. Du siehst, was jedes Einsatzmodell wirklich kostet, drückst die Ausgaben per Routing nach unten und drehst die Hähne pro Team auf oder zu, je nachdem, wie viel Risiko du tragen willst. Die beiden Lecks oben sind dieselbe Maschine bei zwei Aufgaben: jede Anfrage an das richtige Modell schicken und das gewählte Einsatzmodell so durchschaubar machen, dass du es steuern kannst.
Ein paar Einschränkungen, ganz offen. Flowstate macht ein Einsatzmodell beobachtbar und steuerbar. Es schreibt deinen Vertrag nicht um. Wenn du einen BAA, Datenhaltung in einer bestimmten Region oder eine vertragliche No-Training-Klausel brauchst, ist das die Enterprise-Tür, und dort sind Routing und Buchführung unsere Aufgabe: Wir verhindern, dass dir die nutzungsabhängige Rechnung davonläuft. Und das Ganze ist eine Geschichte für intensive Nutzung: Bei einem kleinen Team kommt die nutzungsabhängige Rechnung nie in die Nähe des Punkts, an dem sich irgendetwas davon rechnet, wie der Rechner zeigt, sobald du die Nutzung herunterziehst.
Jahrelang sah der Tausch binär aus: Lass die Leute zu dem greifen, was ihnen gerade vor der Nase liegt, und zahl die Rechnung. Oder sperr alles ab und kontrolliere jeden Prompt von Hand.
Es sollte keine binäre Wahl sein zwischen Rechnung schlucken und dein Team mit Nutzungslimits lahmlegen. Route die Aufgabe, und du zahlst keine Opus-Preise mehr für Sonnet-Arbeit. Ordne die Ausgaben zu, und KI ist kein undifferenzierter Margenschlag mehr. Du brauchst nur einen Proxy in der Mitte, der dir die Steuerung gibt.4
Footnotes
-
Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, reports up to 40% fewer calls to the large model with no drop in response quality. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, reports cost reductions of over 2× on parts of its benchmark without compromising quality. Vendor routers advertise higher (40–70%); I’ve modelled to the peer-reviewed figure. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩
-
Anthropic hat die Enterprise-Seat-Gebühren 2026 von der Token-Nutzung entkoppelt. Laut Claude Help Center: „Die Nutzung ist nicht in der Seat-Gebühr enthalten. Jedes Token, das dein Team verbraucht, in Chat, Claude Code oder Cowork, wird zu Standard-API-Preisen zusätzlich zu den Seat-Kosten abgerechnet.” Die Sitzungslimits pro Seat unterscheiden sich je nach Stufe, ein Team-Premium-Seat hat etwa das 6,25-Fache des Limits pro Sitzung von Pro. Veröffentlichte Basis-Seats kosten $20 (Team Standard und Enterprise) und $100 (Team Premium). Echte Enterprise-Preise werden im Vertrieb verhandelt. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩
-
IAS 38 Intangible Assets (Entwicklungsphase) und ASC 350-40 (intern genutzte Software) regeln, wann Entwicklungskosten aktiviert statt als Aufwand verbucht werden dürfen. Ob die Voraussetzungen erfüllt sind, ist eine Frage von Beurteilung und Prüfung, nicht von Behauptung. Nichts hier ist Bilanzierungsberatung. ↩
-
Ich habe Flowstate mitgegründet, es gilt also die naheliegende Offenlegung des Interessenkonflikts. Die Routing-Zahlen oben sind aus öffentlichen Preisen und der zitierten Forschung modelliert, nicht aus einem Kundenkonto. ↩