Transforme uma conta de IA de $3 milhões em $1,9 milhão
Nesta página
Agora mesmo, alguém do seu time está usando o modelo de IA mais caro para editar uma apresentação. Essa pessoa não escolheu. É só o padrão. Repita essa escolha invisível alguns milhares de vezes por dia, e a sua conta de IA logo passa a parecer folha de pagamento.
Duas coisas inflam esse número. O modelo padrão é o errado para a tarefa: preço de topo de linha para um trabalho que um modelo mais barato resolveria sem esforço. E a tarefa é invisível na fatura, um valor único, sem como saber em qual projeto ou em qual modelo o dinheiro foi gasto.
O Flowstate fica no caminho da requisição para fechar os dois vazamentos. Roteamos cada prompt para o modelo de que a tarefa realmente precisa e ligamos cada dólar ao trabalho que ele pagou. Ninguém entrega menos: o mesmo resultado que custava $3 milhões agora custa $1,9 milhão, e pela primeira vez você enxerga o que o dinheiro realmente comprou.
Você paga preço de Opus por trabalho de Sonnet
Quase ninguém escolhe um modelo. Usa o que estiver selecionado quando a caixa de texto carrega, e o padrão é o topo de linha: o modelo mais caro da prateleira. É a escolha certa para um problema realmente difícil e puro desperdício para um e-mail de uma linha. Você não pode esperar que alguém do marketing saiba que a janela de chat padrão custa cinco vezes mais que o necessário. O preço não aparece na tela, e o fornecedor não tem nenhum incentivo para mostrar.
Então não faça a pessoa aprender isso. Quem escolhe o modelo deve ser a tarefa, não quem digita, e essa decisão pertence à camada de requisição, não à cabeça de ninguém. Um resumo ou uma reformatação vai para o Haiku, programação e redação do dia a dia para o Sonnet, o raciocínio realmente difícil para o Opus. Dá até para dividir um único trabalho: planejar no Opus e executar no Sonnet, guardando o pensamento caro para as etapas que precisam dele. A pessoa, não importa o que faça o dia todo, digita o mesmo prompt e recebe a mesma resposta. A conta é que fica menor. E isso vai bem além do Claude Code: o mesmo padrão está na frente de todo chat que o pessoal de vendas, de operações e de marketing abre.
Quão menor? Pesquisas revisadas por pares, como o Hybrid LLM de Ding et al., mostram que dá para cortar em até 40% as chamadas ao modelo caro sem queda mensurável de qualidade1. É só aritmética em cima da sua mistura de modelos, e funciona em qualquer implantação que você já rode de forma legítima.
Essa é a alavanca que cresce com o uso: quanto mais forte o seu time se apoia na IA, mais um padrão com o modelo errado custa, e mais o roteamento devolve. Na calculadora abaixo, é a distância entre a sua linha em destaque e a verde.
A conta que você não vê
É o primeiro dia. Um engenheiro entra numa empresa, recebe uma conta Enterprise do Claude e queima $145 nos primeiros cinco prompts. Num plano de preço fixo, esse uso teria durado a semana toda. Num plano Enterprise medido, acaba antes do almoço. O RH já está fazendo perguntas que ele não sabe responder, e ele está fazendo as contas de um mês de $5.000: “mais do que o meu salário”. Onde a página de uso deveria mostrar um limite, ela mostra uma palavra: Unlimited. É um post real do r/ClaudeCode, e é o segundo vazamento numa única captura de tela.
O primeiro vazamento foi o modelo que ninguém escolheu. Este é o outro: o medidor que ninguém está olhando. Desde este ano, o Enterprise cobra cada token que o seu time gasta no chat, no Claude Code e no Cowork, pelas tarifas padrão da API, além da licença2. (O Teams mantém uma licença de preço fixo com uma franquia incluída.) O preço medido é barato para um time pequeno, mas foge do controle em escala, e como chega como uma fatura única e indiferenciada, ninguém percebe o pico até o financeiro levantar a mão. Você não consegue rotear o que não enxerga e não consegue escolher entre duas implantações que nunca comparou. Então compare:
Escolha sua porta. Dimensione seu time. Arraste o uso.
Gasto anual com IA no modelo de contratação escolhido (em negrito), o mesmo modelo com o roteamento da Flowstate e as outras portas para comparar. A distância até a linha verde é o que o roteamento economiza para você. A distância até a linha tracejada mais barata é o que a sua porta custa.
Veja o que acontece quando você arrasta. Com pouco uso, as duas portas quase não se diferenciam, e o Enterprise até sai mais barato, e por isso nada disso importa para um time pequeno. Aumente o uso e a linha medida dispara. O roteamento tira de volta de um terço até metade dela, e no topo até migrar para uma licença Teams de preço fixo começa a compensar. Mas você só consegue fazer qualquer uma dessas jogadas quando enxerga a conta com clareza suficiente para comparar, e a maioria dos times não enxerga.
Quais projetos realmente se pagaram
O roteamento corrige o que você paga por tarefa. A pergunta mais difícil é o que você comprou com isso, e isso não dá para ler na fatura. O custo é só a metade da qual as pessoas discutem. A atribuição é a metade que custa mais caro, sem alarde.
Quando alguém gasta $300 de Opus no mês, a pergunta não é qual modelo, é qual projeto. Se você não sabe responder, cada dólar cai no mesmo balde indiferenciado de OpEx e é lançado como despesa no instante em que é gasto. O financeiro vê uma cobrança da Anthropic e um número, não consegue ligá-lo a uma pessoa nem a um trabalho, e por isso não pode fazer nada além de ver o valor crescer. É uma segunda folha de pagamento sem centros de custo.
Uma conta sem contexto é só uma conta, um número que subiu. Com contexto, vira um mapa. Você enxerga que o time que constrói o novo fluxo de cobrança queima $40 mil de tempo de modelo por mês, enquanto um experimento que ninguém aprovou queima $60 mil. Enxerga quais funcionalidades custam mais para entregar do que jamais vão render, e quais baratas estão carregando o roadmap nas costas. Isso não é corte de custo. É saber onde está a sua alavanca, qual trabalho alimentar e qual deixar passar fome. O gasto atribuído deixa de ser o número que o financeiro teme e vira a leitura mais afiada que você tem de onde o valor está sendo gerado.
E isso muda a contabilidade, não só o relatório dela. O gasto com IA que vai para a construção de software novo pode ser capitalizado e amortizado ao longo da vida útil, como o desenvolvimento de software tradicional sob a IAS 38 ou a ASC 350-403. O obstáculo nunca foram as regras contábeis. Foi a falta de atribuição. Você não consegue capitalizar o que não consegue atribuir, e a fatura do fornecedor não atribui nada. O Flowstate liga cada chamada a uma pessoa, um projeto, um modelo e uma classe de custo, e assim o trabalho que constrói valor de verdade para de se esconder no OpEx.
E quanto mais do seu trabalho se qualifica, maior isso fica. Se 70% do seu esforço de desenvolvimento é genuinamente construir produto novo (e para muitos times é), a atribuição tira a maior parte desse gasto com IA do resultado deste trimestre e o leva para o balanço, para ser amortizado ao longo dos anos em que o software rende. Numa conta de IA de sete dígitos, isso não é arrumação de casa. É a diferença entre um golpe na margem agora e um ativo que você recupera depois. (Se um projeto específico se qualifica é um julgamento para o seu time de finanças e de auditoria, não para um post de blog.)
Onde a gente entra
O Flowstate é um proxy inteligente: pense no Zscaler, mas para o tráfego de IA. A gente não junta contas e não guarda os seus contratos. Você mantém as suas próprias chaves e o seu próprio acordo com cada fornecedor que o seu time usa. Ficamos no caminho da requisição e fazemos três coisas com cada chamada que passa: roteamos para o modelo de que a tarefa realmente precisa, inspecionamos em busca do que nunca deveria sair (código-fonte, dados pessoais de clientes indo para onde não devem) e registramos contra uma pessoa, um projeto e uma classe de custo. É a visibilidade pela qual o Enterprise cobra um prêmio, sem o prêmio e sem entregar os seus contratos a ninguém.
Como somos um proxy e não um pool de contas, o lugar que você ocupa nos termos de um fornecedor continua sendo uma decisão sua, tomada com o quadro completo na frente, e não no escuro. Você enxerga quanto cada implantação realmente custa, reduz o gasto com roteamento e abre ou fecha as torneiras por time conforme o risco que está disposto a assumir. Os dois vazamentos acima são a mesma máquina fazendo dois trabalhos: mandar cada requisição para o modelo certo e deixar a implantação que você escolheu legível o suficiente para ser gerida.
Algumas ressalvas, sem rodeios. O Flowstate torna uma implantação observável e controlável. Ele não reescreve o seu contrato. Se você precisa de um BAA, de residência de dados ou de uma cláusula contratual de não treinamento, essa é a porta do Enterprise, e nela o nosso trabalho é o roteamento e o livro-razão: impedir que a conta medida fuja do seu controle. E tudo isso é uma história de uso intenso: para um time pequeno, a conta medida nunca chega perto do ponto em que qualquer coisa disso se paga, como a calculadora mostra assim que você arrasta o uso para baixo.
Por anos, a escolha pareceu binária: deixar as pessoas pegarem o modelo que estiver na frente e engolir a conta, ou travar tudo e policiar cada prompt na mão.
Não deveria ser uma escolha binária entre engolir a conta e paralisar o seu time com limites de uso. Roteie a tarefa, e você para de pagar preço de Opus por trabalho de Sonnet. Atribua o gasto, e a IA deixa de ser um golpe indiferenciado na margem. Falta só um proxy no meio para dar os controles.4
Footnotes
-
Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, relata até 40% menos chamadas ao modelo grande sem queda na qualidade das respostas. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, relata reduções de custo de mais de 2× em partes do benchmark sem comprometer a qualidade. Roteadores de fornecedores anunciam mais (40–70%). Modelei com o número revisado por pares. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩
-
A Anthropic separou as tarifas de licença do Enterprise do uso de tokens em 2026: segundo a Central de Ajuda do Claude, “Usage isn’t included in the seat fee… Every token your team uses” (no chat, no Claude Code ou no Cowork) “is billed at standard API rates on top of your seat cost.” Os limites de sessão por licença variam por plano, com uma licença Team Premium tendo cerca de 6,25× o limite por sessão do Pro. As licenças base publicadas custam $20 (Team Standard e Enterprise) e $100 (Team Premium). O preço real do Enterprise é negociado com vendas. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩
-
A IAS 38 Intangible Assets (fase de desenvolvimento) e a ASC 350-40 (software de uso interno) definem quando o custo de desenvolvimento pode ser capitalizado em vez de lançado como despesa. A elegibilidade depende de julgamento e de auditoria, não de afirmação. Nada aqui é aconselhamento contábil. ↩
-
Sou cofundador do Flowstate, então vale a divulgação óbvia de conflito de interesses. Os números de roteamento acima são modelados a partir de preços públicos e da pesquisa citada, não de uma conta de cliente. ↩