← Tous les articles

Transforme une facture IA de 3§M$ en 1,9§M$

Sur cette page

En ce moment, quelqu’un dans ton équipe utilise le modèle d’IA le plus cher pour retoucher un diaporama. Il ne l’a pas choisi. C’est juste le modèle par défaut. Répète ce choix invisible quelques milliers de fois par jour, et ta facture d’IA ressemble vite à une masse salariale.

Deux choses gonflent ce chiffre. Le modèle par défaut ne convient pas à la tâche : tu paies le prix du modèle phare pour un travail qu’un modèle moins cher réussirait sans problème. Et la tâche est invisible sur la facture, une somme unique sans moyen de savoir sur quel projet ni sur quel modèle elle est partie.

Flowstate se place sur le chemin des requêtes pour boucher les deux fuites. On envoie chaque prompt vers le modèle dont la tâche a vraiment besoin, et on rattache chaque dollar au travail qu’il a payé. Personne ne livre moins : le même résultat qui te coûtait 3§M$ en coûte maintenant 1,9§M$, et pour la première fois tu vois ce que l’argent a vraiment acheté.

Tu paies du Opus pour du travail de Sonnet

Presque personne ne choisit son modèle. On prend celui qui est sélectionné à l’ouverture de la fenêtre, et le défaut, c’est le modèle phare : le plus cher de la gamme. C’est le bon choix pour un problème vraiment difficile et du gaspillage pur pour un e-mail d’une ligne. Tu ne peux pas attendre d’un marketeur qu’il sache que sa fenêtre de chat par défaut coûte cinq fois plus que nécessaire. Le prix n’est pas à l’écran, et l’éditeur n’a aucun intérêt à l’afficher.

Alors ne lui demande pas de l’apprendre. C’est la tâche qui doit choisir le modèle, pas la personne qui tape, et cette décision appartient à la couche des requêtes, pas à la tête de quelqu’un. Un résumé ou un reformatage part chez Haiku, le code et la rédaction de tous les jours chez Sonnet, le raisonnement vraiment difficile chez Opus. Tu peux même couper un seul travail en deux : planifier dans Opus, exécuter sur Sonnet, et garder la réflexion coûteuse pour les étapes qui l’exigent. La personne, quoi qu’elle fasse de ses journées, tape le même prompt et obtient la même réponse. La facture est juste plus petite. Et ça dépasse largement Claude Code : le même défaut se trouve devant chaque chat que tes équipes commerciales, ops et marketing ouvrent aussi.

De combien plus petite ? Des recherches relues par des pairs, comme le Hybrid LLM de Ding et al., montrent qu’on peut réduire jusqu’à 40 % les appels au modèle coûteux sans baisse mesurable de qualité1. C’est de l’arithmétique sur ta répartition de modèles, et ça marche sur n’importe quel déploiement que tu utilises légitimement.

C’est le levier qui grandit avec l’usage : plus ton équipe s’appuie sur l’IA, plus un mauvais modèle par défaut te coûte, et plus le routage te rend. Dans la calculette ci-dessous, c’est l’écart entre ta ligne en gras et la verte.

La facture que tu ne vois pas

Premier jour. Un ingénieur rejoint une entreprise, on lui remet un compte Claude Enterprise, et il brûle 145 $ dans ses cinq premiers prompts. Sur un forfait fixe, cet usage aurait duré toute la semaine. Sur un forfait Enterprise à la consommation, tout est parti avant midi. Les RH lui posent déjà des questions auxquelles il ne sait pas répondre, et il calcule un mois à 5 000 $ : « plus que mon salaire ». Là où la page d’usage devrait afficher une limite, elle affiche un seul mot : Unlimited. C’est un vrai post de r/ClaudeCode, et c’est la deuxième fuite dans une seule capture d’écran.

La première fuite, c’était le modèle que personne n’a choisi. Voici l’autre : le compteur que personne ne surveille. Depuis cette année, Enterprise facture chaque token que ton équipe dépense dans le chat, Claude Code et Cowork, au tarif API standard, en plus du siège2. (Teams garde à la place un siège forfaitaire avec une allocation incluse.) La facturation à la consommation coûte peu pour une petite équipe, mais elle t’échappe à grande échelle, et comme elle arrive sur une seule facture indifférenciée, personne ne repère le pic avant que la finance tire la sonnette. Tu ne peux pas router ce que tu ne vois pas, et tu ne peux pas choisir entre deux déploiements que tu n’as jamais comparés. Alors compare-les :

Choisis ta porte. Dimensionne ton équipe. Fais glisser l'usage.

Dépense annuelle d'IA pour le déploiement choisi (en gras), le même déploiement avec le routage Flowstate, et les autres portes pour comparer. L'écart avec la ligne verte, c'est ce que le routage t'économise. L'écart avec la ligne pointillée la moins chère, c'est ce que ta porte te coûte.

Claude for Enterprise, aujourd'hui
3,26 M$/an
ton choix, sans routage
+ routage Flowstate
1,89 M$/an
économise 1,38 M$ (42 %)
Porte la moins chère : Teams (Premium)
2,35 M$/an
915 k$ de moins que ta porte
0 $2,63 M$5,25 M$7,88 M$10,50 M$0M250M500M750M1000Mtokens par membre de l'équipe / mois
Claude for Enterprise, aujourd'huiClaude for Enterprise + FlowstateClaude for Teams (Premium)
375M

Regarde ce qui se passe quand tu la fais glisser. À faible usage, les deux portes diffèrent à peine, et Enterprise est même la moins chère, ce qui explique pourquoi rien de tout ça n’a d’importance pour une petite équipe. Monte l’usage et la ligne à la consommation s’envole. Le routage lui reprend d’un tiers à la moitié, et tout en haut, même passer à un siège Teams forfaitaire commence à l’emporter. Mais tu ne peux faire l’un ou l’autre qu’une fois que tu vois la facture assez clairement pour comparer, et la plupart des équipes n’y arrivent pas.

Quels projets se sont vraiment remboursés

Le routage règle ce que tu paies par tâche. La question plus dure, c’est ce que tu as acheté avec, et la facture ne te le dit pas du tout. Le coût n’est que la moitié dont les gens débattent. L’attribution est la moitié qui coûte le plus cher sans bruit.

Quand quelqu’un dépense 300 $ d’Opus ce mois-ci, la question n’est pas quel modèle, c’est quel projet. Si tu ne sais pas répondre, chaque dollar tombe dans le même sac d’OpEx indifférencié et passe en charges à l’instant où il est dépensé. La finance voit une ligne d’Anthropic et un montant, n’arrive pas à le rattacher à une personne ni à un travail, et ne peut rien en faire d’autre que le regarder grossir. C’est une deuxième masse salariale sans centres de coûts.

Une facture sans contexte n’est qu’une facture, un chiffre qui a monté. Avec du contexte, elle devient une carte. Tu vois que l’équipe qui construit le nouveau parcours de facturation brûle 40 k$ de temps de modèle par mois, pendant qu’une expérience que personne n’a validée en brûle 60 k$. Tu vois quelles fonctionnalités coûtent plus cher à livrer qu’elles ne rapporteront jamais, et quelles petites fonctionnalités portent la feuille de route sans faire de bruit. Ce n’est pas de la réduction de coûts. C’est savoir où se trouve ton levier, quel travail nourrir et lequel affamer. La dépense attribuée cesse d’être le chiffre que la finance redoute et devient la lecture la plus fine que tu aies de l’endroit où la valeur se crée vraiment.

Et ça change la comptabilité, pas seulement son reporting. La dépense d’IA qui sert à construire un nouveau logiciel peut être immobilisée et amortie sur sa durée d’utilité, comme le développement logiciel classique sous IAS 38 ou ASC 350-403. Le blocage n’a jamais été les règles comptables. C’était le manque d’attribution. Tu ne peux pas immobiliser ce que tu ne peux pas attribuer, et la facture du fournisseur n’attribue rien. Flowstate relie chaque appel à une personne, un projet, un modèle et une classe de coût, pour que le travail qui construit de la vraie valeur cesse de se cacher dans l’OpEx.

Et plus ton travail y est éligible, plus l’effet grossit. Si 70 % de ton effort de développement construit réellement du nouveau produit (et pour beaucoup d’équipes c’est le cas), l’attribution déplace l’essentiel de cette dépense d’IA du compte de résultat de ce trimestre vers le bilan, à amortir sur les années où le logiciel rapporte. Sur une facture d’IA à sept chiffres, ce n’est pas de l’intendance. C’est la différence entre un coup sur la marge maintenant et un actif que tu récupères plus tard. (Savoir si un projet donné y est éligible relève du jugement de ta finance et de ton audit, pas d’un article de blog.)

Où on se place

Flowstate est un proxy intelligent : pense à Zscaler, mais pour le trafic d’IA. On ne mutualise pas les comptes et on ne détient pas tes contrats. Tu gardes tes propres clés et ton propre accord avec chaque fournisseur que ton équipe utilise. On se place sur le chemin des requêtes et on fait trois choses à chaque appel qui passe : le router vers le modèle dont la tâche a vraiment besoin, l’inspecter à la recherche de ce qui ne doit jamais sortir (du code source, des données personnelles de clients qui partent là où elles ne devraient pas), et le consigner contre une personne, un projet et une classe de coût. C’est la visibilité qu’Enterprise fait payer au prix fort, sans le prix fort, et sans remettre tes contrats à personne.

Comme on est un proxy et pas un pool de comptes, ta position face aux conditions d’un fournisseur reste ta décision, prise avec tout le tableau sous les yeux plutôt que dans le noir. Tu vois ce que coûte réellement chaque déploiement, tu fais baisser la dépense par le routage, et tu ouvres ou fermes le robinet équipe par équipe selon le risque que tu acceptes de porter. Les deux fuites plus haut sont la même machine qui fait deux métiers : envoyer chaque requête vers le bon modèle, et rendre le déploiement que tu as choisi assez lisible pour le piloter.

Quelques réserves, sans détour. Flowstate rend un déploiement observable et contrôlable. Il ne réécrit pas ton contrat. Si tu as besoin d’un BAA, d’une résidence des données ou d’une clause contractuelle d’interdiction d’entraînement, c’est la porte Enterprise, et là notre travail, c’est le routage et le registre : empêcher la facture à la consommation de t’échapper. Et tout ça vaut pour les gros usages : pour une petite équipe, la facture à la consommation n’approche jamais le point où ça se rentabilise, comme la calculette le montre dès que tu fais redescendre l’usage.

Pendant des années, le choix a eu l’air binaire : laisser les gens attraper le modèle qu’ils ont sous la main et encaisser la facture, ou tout verrouiller et fliquer chaque prompt à la main.

Ça ne devrait pas être un choix binaire entre encaisser la facture et paralyser ton équipe à coups de limites d’usage. Route la tâche, et tu arrêtes de payer du Opus pour du travail de Sonnet. Attribue la dépense, et l’IA cesse d’être un coup indifférencié sur la marge. Il te faut juste un proxy au milieu pour te donner les commandes.4


Footnotes

  1. Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, rapporte jusqu’à 40 % d’appels en moins au grand modèle sans baisse de qualité des réponses. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, rapporte des réductions de coût de plus de 2× sur une partie de son benchmark sans compromis sur la qualité. Les routeurs commerciaux annoncent plus (40 à 70 %), j’ai modélisé avec le chiffre relu par des pairs. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩

  2. Anthropic a dissocié les frais de siège Enterprise de la consommation de tokens en 2026 : selon le Help Center de Claude, « L’usage n’est pas inclus dans les frais de siège… Chaque token que ton équipe utilise, dans le chat, Claude Code ou Cowork, est facturé aux tarifs API standard en plus du coût de ton siège. » Les limites de session par siège varient selon l’offre, un siège Team Premium offrant environ 6,25× la limite par session de Pro. Les sièges de base publiés sont à 20 $ (Team Standard et Enterprise) et 100 $ (Team Premium), le vrai prix Enterprise se négocie avec les commerciaux. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩

  3. IAS 38 Immobilisations incorporelles (phase de développement) et ASC 350-40 (logiciels à usage interne) fixent quand un coût de développement peut être immobilisé plutôt que passé en charges. L’éligibilité relève du jugement et de l’audit, pas de l’affirmation. Rien ici n’est un conseil comptable. ↩

  4. J’ai cofondé Flowstate, donc la déclaration de conflit d’intérêts évidente s’applique. Les chiffres de routage ci-dessus sont modélisés à partir des tarifs publics et des recherches citées, pas d’un compte client. ↩