La loi de Moore de l'IA est officiellement morte
Sur cette page
Google a sorti Gemini 3 Flash aujourd’hui. C’est son nouveau modèle par défaut dans l’application Gemini, partout dans le monde, à la place de Gemini 2.5 Flash.1 Les benchmarks sont impressionnants : il fait mieux que Gemini 2.5 Pro et il va trois fois plus vite.
Mais il y a un hic. Il coûte plus cher.
Les tokens en entrée passent de 0,30 $ à 0,50 $ le million. Les tokens en sortie passent de 2,50 $ à 3,00 $. Ça fait 67 % de plus en entrée et 20 % de plus en sortie.
Les commentaires sur Hacker News l’ont déjà remarqué :
They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2
Ça fait des années qu’on nous répète que le coût de l’IA baisse. Une loi de Moore de l’inférence. Une course vers le bas. Mais est-ce vraiment ce qui se passe ?
Est-ce partout pareil ?
Réponse courte : ça dépend des modèles.
J’ai passé les derniers jours à rassembler l’historique des prix de tous les grands fournisseurs : OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek et Cohere.3 Le tableau est plus nuancé que le récit « l’IA devient moins chère ».
Ce qu’on observe, c’est une reprise en K des prix de l’IA.
Pour ceux qui ne connaissent pas l’expression, une tendance « en K » apparaît quand les différentes parties du marché partent dans des directions opposées : une branche du K file vers le haut pendant que l’autre plonge. Dans l’IA, le coût de l’intelligence brute se scinde. Certains acteurs de base continuent la course vers le bas, mais les modèles sur lesquels on s’appuie pour le travail sérieux deviennent de plus en plus chers. Cela dit, ça ressemble moins à un K qu’à un <, un crocodile gueule grande ouverte, prêt à avaler un fondateur d’IA.
Voilà ce que j’ai trouvé.
L’évolution des prix des modèles de pointe
D’abord, les modèles de pointe. C’est le meilleur de chaque fournisseur, les têtes de file de la recherche qui repoussent les limites du calcul. C’est ce que tu utilises pour le raisonnement complexe, les workflows agentiques et les tâches où la qualité compte plus que le coût.
Prix en entrée ($ / 1 M de tokens)
Prix en sortie ($ / 1 M de tokens)
L’histoire des modèles de pointe est brouillonne. Le plancher monte. Pendant qu’on fêtait les baisses de 80 % de 2024, les modèles de pointe de 2025 arrivent avec une prime. On ne paie pas seulement plus d’intelligence. On paie aussi les énormes factures de R&D et d’énergie qui sont enfin tombées.
OpenAI a baissé les prix de GPT-4 de 83 % en 18 mois,4 mais la tendance s’est inversée avec GPT-5 et des modèles spécialisés comme o1-pro. Anthropic a maintenu Claude Opus à 15 $ / 75 $ pendant presque deux ans avant de baisser Opus 4.5 de 67 %.5 Google a taillé dans le prix de Gemini 1.5 Pro fin 2024, avant de remonter ceux de Gemini 3 Pro.
La seule chose qui garde en vie le récit de la « course vers le bas » ? DeepSeek. Son V3 à 0,28 $ / 1,10 $ coûte 18 fois moins cher que GPT-5 et 54 fois moins cher que Claude Opus à son sommet. C’est le trouble-fête : la preuve que des gains d’efficacité sont possibles, mais aussi une anomalie que les labos occidentaux n’ont pas égalée.
L’évolution des prix des modèles économiques
Les modèles économiques, les bêtes de somme de la production à gros volume, montrent une divergence encore plus nette.
Prix en entrée ($ / 1 M de tokens)
Prix en sortie ($ / 1 M de tokens)
Là, ça devient intéressant.
La gamme rapide d’OpenAI a baissé de 92 %, de GPT-3.5 Turbo (2 $ / 2 $) à GPT-4o mini (0,15 $ / 0,60 $). C’est le récit qu’on nous a servi.
Mais regarde Anthropic. Claude 3 Haiku est sorti à 0,25 $ / 1,25 $ en mars 2024. Puis Claude 3.5 Haiku est arrivé en novembre 2024 à 1,00 $ / 5,00 $.6 C’est une hausse de prix par 4 pour le modèle « économique ».
Et Google ? Gemini 1.5 Flash est tombé à 0,075 $ / 0,30 $ en août 2024. Le Gemini 3 Flash d’aujourd’hui ? 0,50 $ / 3,00 $. C’est 6,7 fois plus en entrée et 10 fois plus en sortie.
Dans la gamme économique, la tendance n’est pas à la baisse partout. Tout dépend du fournisseur que tu utilises.
Les prix suivent-ils les progrès réels ?
Bonne question. Peut-être que les prix montent parce que les modèles s’améliorent énormément ?
Scores MMLU dans le temps
Scores HumanEval dans le temps (code)
Les benchmarks racontent une histoire nuancée.
Les scores MMLU se concentrent autour de 88 à 92 % pour les meilleurs modèles.7 GPT-4 a atteint 86,4 % en mars 2023. GPT-5 atteint 91,4 % aujourd’hui. Ça fait 5,8 points de pourcentage en presque trois ans. L’écart entre fournisseurs s’est réduit à quelques points.
HumanEval montre des gains plus spectaculaires, de 67 % à plus de 92 % pour les leaders. Mais là encore, les meilleurs modèles convergent.
Voilà la vérité qui dérange : les benchmarks progressent moins vite alors que certains prix augmentent. La courbe prix/performance est moins favorable qu’en 2023-2024.
Qu’est-ce qui fait monter les prix ?
On a atteint un plafond d’efficacité de l’inférence.
On a optimisé tous les fruits à portée de main : cache KV, quantification, ajustements d’architecture. Pour gagner un cran de raisonnement, on jette maintenant de la puissance de calcul brute sur le problème pendant l’inférence, avec des itérations internes de « chaîne de pensée ». Tu ne peux pas optimiser ton chemin hors d’un modèle qui doit « réfléchir » 10 secondes avant de répondre.
Les autres facteurs :
- Le coût de l’énergie. Les datacenters se disputent une capacité électrique limitée à l’échelle mondiale. Google, Microsoft et Amazon signent des contrats d’achat d’électricité à long terme qui se chiffrent en milliards.
- Le retour sur capital. Les hyperscalers qui dépensent 50 à 100 Md$ par an en infrastructure doivent maintenant prouver leur rentabilité à leurs investisseurs. La phase de « ruée vers les terres » est terminée.
- Les licences de données. L’ère des données d’entraînement gratuites touche à sa fin. Des entreprises paient des millions pour du texte humain de qualité.
L’effet en aval : l’« illimité » est mort
Si les prix des modèles en amont augmentent, que devient tout ce qu’on construit par-dessus ?
On voit partout un virage vers la tarification à l’usage.
Cursor est passé à des crédits à l’usage en juin 2025.8 Quand Claude Opus 4 est resté à 15 $ / 75 $, l’abonnement « Pro » à prix fixe de Cursor est devenu une œuvre de charité. Ce n’était pas un choix, c’était une manœuvre de survie.9 Les gros utilisateurs paient maintenant de 100 à 200 $ par mois.
GitHub Copilot a introduit les « requêtes premium » et commencé à appliquer des plafonds en juin 2025.10 Le 2 décembre 2025, GitHub a supprimé les budgets à 0 $ hérités sur lesquels beaucoup de comptes entreprise comptaient pour bloquer les dépassements.11 Si tu n’as pas revu tes réglages de facturation Copilot récemment, tu risques une mauvaise surprise.
Lovable est passé à des déductions selon la complexité en juillet 2025.12 Sa documentation prévient maintenant : « If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned. »
Le schéma est clair. Chaque grand outil de développement alimenté par l’IA est passé, ou passe, de forfaits « illimités » à prix fixe à des modèles à la consommation. Ce n’est pas de la cupidité. C’est l’économie sous-jacente qui rattrape tout le monde.
Et le quantique ?
Il y a une certaine ironie à ce que Google, l’entreprise qui vient de multiplier par 10 les prix de Gemini Flash, détienne peut-être aussi la clé pour rendre l’IA abordable à nouveau.
Sa puce quantique Willow et son algorithme « Quantum Echoes » revendiquent des performances 13 000 fois supérieures à celles des supercalculateurs.1314 La promesse, c’est que le matériel quantique pourrait révolutionner les multiplications de matrices qui rendent l’inférence des réseaux de neurones si chère.
Mais soyons sérieux.
Google nous demande de parier sur un futur quantique multi-univers pour résoudre un problème de prix qu’il a créé dans le présent.15 C’est un classique de la diversion. Tant que je ne peux pas brancher Willow sur une API de production à 0,01 $ par 1 M de tokens, ce n’est que de la com’ aromatisée à la physique.
C’est l’entreprise qui a tué 293 produits.16 Même si l’inférence quantique devient viable, son historique laisse penser qu’elle trouverait le moyen de la rendre chère, de l’enfermer dans son cloud ou de l’abandonner pour de bon.
Le paysage des prix de l’IA n’est plus une simple histoire de coûts qui baissent. C’est une bifurcation en K où l’intelligence de pointe et les bêtes de somme fiables deviennent plus chères. Si tu ne suis pas tes dépenses d’IA dans le détail, tu auras une surprise quand la facture arrivera.
Si ça te parle, c’est peut-être le moment d’en discuter avec flowstate.
Énormément de recherches ont été faites avec l’aide de l’Internet Archive. Pour une bonne partie de cet article, j’ai dû parcourir d’anciennes versions de sites web. Si la mission de l’Internet Archive, préserver l’histoire du numérique, te parle, pense à les soutenir avec un don.
Footnotes
-
Google Gemini 3 Flash announcement (December 2025) ↩
-
Hacker News discussion on Gemini 3 Flash (December 2025) ↩
-
Pricing data compiled from official documentation: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩
-
OpenAI API Pricing - historical pricing via Wayback Machine ↩
-
Claude 3.5 Haiku announcement (November 2024) ↩
-
Cursor pricing changes (June 2025) ↩
-
GitHub Copilot billing changes (December 2025) ↩
-
Google Willow quantum chip announcement (December 2024) ↩
-
Google Quantum Echoes demonstration - Nature (October 2025) ↩
-
Hartmut Neven, founder of Google Quantum AI, on Willow and the multiverse hypothesis ↩
-
Killed by Google - the Google graveyard ↩