Raus aus der KI-Kostenfalle
Auf dieser Seite
Ich habe lange nichts mehr geschrieben. Ich nehme mir zwei Wochen frei, im Süden Frankreichs, mit Familie und Freunden. Unsere Debatten am Esstisch drehen sich immer wieder um KI: ihre Komplexität, ihr Potenzial und die gewaltigen Probleme bei ihrer Finanzierung.
KI ist für Endnutzer gerade billig, aber nur, weil Risikokapital die Rechnung zahlt. Training und Inferenz sind weiterhin teuer, und irgendjemand muss dafür aufkommen. Im Moment sind das die Investoren. Aber die Preise bleiben nicht ewig niedrig. Die Rechnung geht schlicht nicht auf.
Subventionen halten nicht ewig
Die Milliarden, die OpenAI, Anthropic, Mistral und andere eingesammelt haben, fließen in Rechenleistung, Personal und Nvidia-GPUs. Verbraucher sehen subventionierte Preise, aber die Kosten dahinter sind enorm. Der Geldfluss sieht ungefähr so aus:
- VCs / private Investoren pumpen Milliarden in die Modellanbieter.
- Modellanbieter (OpenAI, Anthropic, Mistral) geben dann viel Geld für Cloud-Credits aus.
- Cloud-Anbieter (Microsoft, Amazon, Google) reichen diese Ausgaben an ihre Infrastruktur weiter.
- Diese Infrastruktur läuft am Ende auf GPUs, Rechenzentren, Strom und Personal hinaus.
- Nvidia verbucht Rekordquartale und ist der eigentliche Gewinner.
Eine hübsche kleine Trickle-down-Kette. Nur hebt hier nicht die Flut alle Boote, sondern den Aktienkurs von Nvidia. Die Ähnlichkeit mit den Anfängen der Fahrdienste (z. B. Uber) ist verblüffend: Das Wachstum speist sich aus billigem Kapital, nicht aus gesunden Stückkosten12.
Zwei Strategien: Howie und Jamie
Manche Konkurrenten meines Produkts Jamie, etwa Howie, setzen auf Human-in-the-Loop-Prüfung. Laut einem aktuellen Podcast beschäftigen sie über 60 Leute, die Simulationsergebnisse von Hand prüfen. Das sichert die Qualität, wirft aber Fragen zur Skalierbarkeit auf.
Mit Jamie gehen wir einen anderen Weg. Heute setzen wir in Produktion auf Claude Sonnet 4 und GPT-5. Sonnet ist unser Hauptmodell (auch wenn es manchmal nervig unzuverlässig ist), GPT-5 ist die Ausweichlösung. Beide liefern starke Ergebnisse.
Vertrauen lagern wir aber nicht an Menschen aus. Wir lassen mehrere Modelle parallel laufen, um Ergebnisse zu prüfen, und wiederholen den Lauf, bis die Antwort verlässlich ist. Wir vertrauen den Modellen und unseren Kunden, die bei Bedarf korrigieren, statt das Vertrauen an ein großes Team für manuelle Prüfung zu delegieren.
Außerdem erfassen wir Metadaten zu jedem Austausch. Diese Bruchstücke werden später wieder hervorgeholt und in den Kontext eingewoben, um Antworten anzureichern. Der Assistent merkt sich so nicht nur Fakten, sondern kann auch Nuancen wiederverwenden, etwa Hinweise zur Zeitzone oder beiläufige Details, um die bestmöglichen Antworten zu bauen.
Wer hier wirklich verdient
Ob du Howie bist, Jamie oder ein Modellanbieter: Das Geld fließt immer gleich.
VC-Dollars → Modellanbieter → Cloud-Anbieter → GPUs, Rechenzentren und Talente.
Nvidia dominiert, mit bis zu 95% des Marktes für KI-GPUs3. Jeder Startup-Dollar landet am Ende in deren Quartalszahlen.
Die Grundlast selbst besitzen
Hier der strategische Zug: Besitze deine Grundlast und weiche in die Cloud aus, wenn es sein muss.
- Grundlast bei der Rechenleistung: Langlebige Hardware im Colocation-Rechenzentrum oder sogar im Büro. Über 3–5 Jahre abgeschrieben ergibt das eine stabile, planbare Kostenbasis. KI-Workloads brauchen oft keine schnellsten SSDs. GPU-Zyklen sind der Engpass.
- Rechenleistung für Lastspitzen: Die Cloud für Spitzen, Experimente und Elastizität.
Dieser Hybridansatz schützt dich vor steigenden Cloud-Preisen für Inferenz und lässt dir Flexibilität, wo sie zählt.
Warum wir wieder über Hardware nachdenken
Open Source hat die Rechnung verändert. Metas LLaMA 3 liegt in Benchmarks nah an GPT-5, und wir haben LLaMA und Mistral direkt gegen unsere Claude- und GPT-5-Ergebnisse getestet. Sie schneiden genauso gut ab45. Das ist ein klarer Ausweg.
Auf einem Mac Studio (M2 Ultra, 192 GB RAM, 1 TB SSD) läuft LLaMA-Inferenz in brauchbarer Geschwindigkeit. Stell 20 davon in ein Büro, und du hast ernstzunehmenden, dauerhaften Durchsatz für einen Bruchteil der Kosten von Cloud-Inferenz.
Kurzer Kostenvergleich: Mac Studio gegen OpenAI
Mac Studio (M2 Ultra, 192 GB RAM, 1 TB SSD)
- Kosten pro Stück (2025): ≈$7.000 USD (≈£5.400)
- 20 Stück: ≈$140.000 USD (≈£109.000)
- Lebensdauer: ~2–3 Jahre (konservativ für ML-Workloads)6
Vergleichbare Ausgaben bei OpenAI/Anthropic
- GPT-5-Preise (Sept. 2025): $1,25 pro Million Tokens Input, $10 pro Million Tokens Output7
- Claude-Sonnet-4-Preise: $3 pro Million Tokens Input, $15 pro Million Tokens Output8
- Ein Produkt mittlerer Größe mit ~500M Tokens im Monat (für Assistenten im großen Maßstab sehr bescheiden) = ≈$14.625/Monat bei Nutzung von GPT-5 + Claude Sonnet 4
- 2 Jahre = ≈$351.000 (≈£273.000)
Das sind fast 3x so viel, wie Kauf und Betrieb eigener Hardware kosten. Und der Abstand wächst mit der Größe.
Das wahrscheinliche Ergebnis für uns
Solange die Modelle nicht radikal effizienter werden, steigen die Preise, sobald die VC-Subventionen versiegen. Wir haben aber bereits gezeigt, dass Open Source mit den Ergebnissen der Frontier-Modelle mithalten kann.
Deshalb ist das wahrscheinliche Ergebnis für uns einfach:
- Weg von der Abhängigkeit von Claude und GPT-5
- LLaMA und selbst trainierte oder feinjustierte offene Modelle einsetzen
- Kosten mit Grundlast-Hardware verankern, nur bei Bedarf in die Cloud ausweichen
Die Zukunft der KI gehört nicht allein denen mit dem meisten Kapital. Sie gehört denen, die kluge, effiziente Stacks bauen.
Footnotes
-
Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩
-
Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩
-
Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩
-
Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩
-
Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩