← Tous les articles

Sortir du piège des coûts de l'IA

Sur cette page

Ça fait un moment que je n’avais rien écrit. Je prends deux semaines dans le sud de la France, en famille et entre amis. Les débats autour de la table ramènent sans cesse à l’IA : sa complexité, son potentiel et les gros problèmes de son financement.

L’IA est bon marché pour les utilisateurs finaux en ce moment, mais seulement parce que le capital-risque règle la note. L’entraînement et l’inférence coûtent toujours très cher, et quelqu’un doit payer. Pour l’instant, ce « quelqu’un », ce sont les investisseurs. Mais les prix ne resteront pas bas éternellement. Les comptes ne tiennent tout simplement pas.

Les subventions ne dureront pas

Les milliards levés par OpenAI, Anthropic, Mistral et les autres partent en calcul, en salaires et en GPU Nvidia. Le grand public voit des prix subventionnés, mais les coûts réels sont énormes. Le flux d’argent ressemble à ça :

  1. Les VC et les investisseurs privés injectent des milliards chez les fournisseurs de modèles.
  2. Les fournisseurs de modèles (OpenAI, Anthropic, Mistral) dépensent ensuite gros en crédits cloud.
  3. Les fournisseurs de cloud (Microsoft, Amazon, Google) répercutent cette dépense sur leur infrastructure.
  4. Cette infrastructure se résume au final à des GPU, des datacenters, de l’électricité et des salaires.
  5. Nvidia enchaîne les trimestres records et rafle la mise.

C’est une jolie petite chaîne de ruissellement. Sauf que la marée ne soulève pas tous les bateaux, elle soulève le cours de l’action Nvidia. La ressemblance avec les débuts des VTC (Uber, par exemple) est troublante : une croissance alimentée par du capital bon marché, pas par une économie unitaire saine12.

Deux stratégies : Howie et Jamie

Certains concurrents de mon produit Jamie, comme Howie, misent sur une relecture humaine à chaque étape. D’après un podcast récent, ils emploient plus de 60 personnes pour vérifier à la main les résultats des simulations. Ça garantit la qualité, mais ça pose des questions de montée en charge.

Avec Jamie, on a pris un autre chemin. Aujourd’hui, on s’appuie en production sur Claude Sonnet 4 et GPT-5. Sonnet est notre modèle principal (même s’il est parfois d’une fiabilité exaspérante), GPT-5 est le plan B. Les deux donnent de très bons résultats.

Mais on ne délègue pas la confiance à des humains. On fait tourner plusieurs modèles en parallèle pour valider les sorties, et on relance jusqu’à obtenir une réponse fiable. On fait confiance aux modèles et à nos clients, qui corrigent quand il le faut, plutôt que de confier cette confiance à une grosse équipe de relecture manuelle.

On garde aussi des métadonnées sur chaque échange. Ces fragments sont ensuite remontés et recousus dans le contexte pour enrichir les réponses. L’assistant ne retient pas seulement des faits, il peut aussi réutiliser des nuances, comme un indice de fuseau horaire ou un détail lâché en passant, pour construire les meilleures réponses possibles.

Qui touche vraiment l’argent

Que tu sois Howie, Jamie ou un fournisseur de modèles, l’argent suit le même chemin :

Dollars des VC → fournisseurs de modèles → fournisseurs de cloud → GPU, datacenters et talents.

Nvidia domine, avec jusqu’à 95 % du marché des GPU pour l’IA3. Chaque dollar de startup finit dans leurs résultats trimestriels.

Posséder sa charge de base

Voilà le coup stratégique : possède ta charge de base, et pars dans le cloud quand tu n’as pas le choix.

  • Calcul de base : du matériel durable, en colocation ou même au bureau. Amorti sur 3 à 5 ans, il donne une base de coûts stable et prévisible. Les charges d’IA n’ont souvent pas besoin des SSD les plus rapides. Ce sont les cycles de GPU qui limitent.
  • Calcul en pic : le cloud pour les pointes, les expériences et l’élasticité.

Cette approche hybride te protège de la hausse des prix d’inférence dans le cloud et te laisse de la souplesse là où elle compte.

Pourquoi on regarde à nouveau le matériel

L’open source a changé la donne. LLaMA 3 de Meta se rapproche de GPT-5 dans les benchmarks, et on a testé LLaMA et Mistral face à nos sorties Claude et GPT-5. Ils font aussi bien45. C’est une vraie porte de sortie.

Sur un Mac Studio (M2 Ultra, 192 Go de RAM, 1 To de SSD), on fait tourner l’inférence LLaMA à une vitesse utilisable. Mets-en 20 dans un bureau et tu obtiens un débit soutenu, sérieux, pour une fraction du prix de l’inférence dans le cloud.


Comparaison rapide des coûts : Mac Studio contre OpenAI

Mac Studio (M2 Ultra, 192 Go de RAM, 1 To de SSD)

  • Prix à l’unité (2025) : ≈ 7 000 $ USD (≈ 5 400 £)
  • 20 unités : ≈ 140 000 $ USD (≈ 109 000 £)
  • Durée de vie : ~2 à 3 ans (prudent pour des charges de ML)6

Dépense équivalente chez OpenAI/Anthropic

  • Tarifs GPT-5 (sept. 2025) : 1,25 $ par million de tokens en entrée, 10 $ par million de tokens en sortie7
  • Tarifs Claude Sonnet 4 : 3 $ par million de tokens en entrée, 15 $ par million de tokens en sortie8
  • Un produit de taille moyenne qui consomme ~500 M de tokens par mois (très modeste pour des assistants à grande échelle) = ≈ 14 625 $/mois entre GPT-5 et Claude Sonnet 4
  • 2 ans = ≈ 351 000 $ (≈ 273 000 £)

C’est presque 3 fois le prix d’un achat et d’une exploitation de ton propre matériel. Et l’écart se creuse avec la taille.


Le scénario probable pour nous

À moins que les modèles ne gagnent radicalement en efficacité, les prix monteront quand les subventions des VC se tariront. Mais on a déjà prouvé que l’open source peut égaler les sorties des modèles de pointe.

C’est pourquoi le scénario probable pour nous est simple :

  • Sortir de la dépendance à Claude et GPT-5
  • Adopter LLaMA et des modèles ouverts entraînés ou affinés par nos soins
  • Ancrer les coûts avec du matériel de base, et partir dans le cloud seulement en cas de besoin

L’avenir de l’IA n’appartiendra pas seulement à ceux qui ont le plus de capital. Il appartiendra à ceux qui construisent des stacks malins et efficaces.


Footnotes

  1. Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩

  2. Sequoia Capital, Generative AI’s Act Two, 2023. Link ↩

  3. Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩

  4. Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩

  5. Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩

  6. Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩

  7. OpenAI, GPT-5 pricing, 2025. Link ↩

  8. Claude, Claude 4 and Claude Sonnet pricing, 2025. Link ↩