Transforma uma fatura de IA de $3m em $1,9m
Nesta página
Neste preciso momento, alguém da tua equipa está a usar o modelo de IA mais caro para editar uma apresentação. Não o escolheu. Veio por defeito. Repete essa escolha invisível alguns milhares de vezes por dia e a tua fatura de IA começa depressa a parecer-se com a folha de salários.
Duas coisas inflacionam esse número. O modelo por defeito é o errado para a tarefa: preços de topo por um trabalho que um modelo mais barato resolveria na perfeição. E a tarefa é invisível na fatura, uma única verba global sem forma de saber em que projeto ou em que modelo foi gasta.
O Flowstate fica no caminho do pedido para fechar as duas fugas. Encaminhamos cada prompt para o modelo de que a tarefa realmente precisa e associamos cada dólar ao trabalho que ele pagou. Ninguém entrega menos: o mesmo resultado que te custava $3m passa a custar $1,9m e, pela primeira vez, vês que trabalho o dinheiro comprou de facto.
Estás a pagar preços de Opus por trabalho de Sonnet
Quase ninguém escolhe um modelo. Usam o que estiver selecionado quando a caixa carrega, e o que vem por defeito é o de topo: o modelo mais caro da oferta. É a decisão certa para um problema genuinamente difícil e puro desperdício para um e-mail de uma linha. Não podes esperar que um profissional de marketing saiba que a janela de chat que abre por defeito lhe custa cinco vezes mais do que o necessário. O preço não aparece no ecrã, e o fornecedor não tem interesse nenhum em mostrá-lo.
Por isso, não os obrigues a aprender. Quem escolhe o modelo deve ser a tarefa, não a pessoa que escreve, e essa decisão pertence à camada do pedido e não à cabeça de ninguém. Um resumo ou uma reformatação vai para o Haiku, o código e os rascunhos do dia a dia para o Sonnet, o raciocínio verdadeiramente difícil para o Opus. Até podes dividir um único trabalho: planeá-lo no Opus e correr a execução no Sonnet, guardando o pensamento caro para os passos que o exigem. A pessoa, faça o que fizer o dia todo, escreve o mesmo prompt e recebe a mesma resposta. A fatura é que é mais pequena. E isto vai muito além do Claude Code: o mesmo valor por defeito está à frente de cada chat que as tuas equipas de vendas, operações e marketing abrem.
Quão mais pequena? A investigação revista por pares, como o Hybrid LLM de Ding et al., mostra que podes cortar até 40% das chamadas ao modelo caro sem queda mensurável na qualidade1. É só aritmética sobre a tua mistura de modelos, e funciona em qualquer implementação que uses legitimamente.
Esta é a alavanca que cresce com a utilização: quanto mais a tua equipa se apoia na IA, mais te custa um modelo errado por defeito e mais o encaminhamento te devolve. Na calculadora abaixo, é a distância entre a tua linha a negrito e a verde.
A fatura que não consegues ver
É o primeiro dia. Um engenheiro entra numa empresa, recebe uma conta Claude Enterprise e gasta $145 nos primeiros cinco prompts. Num plano de preço fixo, essa utilização teria durado a semana toda. Num plano Enterprise medido, acabou antes do almoço. Os recursos humanos já estão a fazer perguntas a que ele não sabe responder, e ele está a fazer contas a um mês de $5 000: “mais do que o meu salário”. Onde a página de utilização devia mostrar um limite, mostra uma palavra: Unlimited. É uma publicação real do r/ClaudeCode, e é a segunda fuga numa só captura de ecrã.
A primeira fuga era o modelo que ninguém escolheu. Esta é a outra: o contador que ninguém vigia. Este ano, o Enterprise cobra cada token que a tua equipa gasta no chat, no Claude Code e no Cowork, às tarifas padrão da API, por cima do lugar2. (O Teams mantém um lugar a preço fixo, com uma franquia incluída.) O preço medido é barato para uma equipa pequena, mas foge-te das mãos em escala, e como chega numa fatura única e indiferenciada, ninguém dá pelo pico até as finanças levantarem a bandeira. Não podes encaminhar o que não vês, e não podes escolher entre duas implementações que nunca comparaste. Por isso, compara-as:
Escolhe a tua porta. Dimensiona a tua equipa. Arrasta o uso.
Gasto anual com IA no modelo de adoção escolhido (a negrito), o mesmo modelo com o encaminhamento da Flowstate e as outras portas, para comparar. A distância até à linha verde é o que o encaminhamento te poupa. A distância até à linha tracejada mais barata é o que a tua porta te custa.
Repara no que acontece quando arrastas. Com pouca utilização, as duas portas quase não diferem, e o Enterprise é na verdade o mais barato, e é por isso que nada disto importa para uma equipa pequena. Sobe a utilização e a linha medida dispara. O encaminhamento tira-lhe logo um terço a metade e, no extremo, até passar para um lugar Teams de preço fixo começa a compensar. Mas só consegues fazer qualquer destes movimentos quando vês a fatura com clareza suficiente para comparar, e a maioria das equipas não vê.
Que projetos se pagaram a si próprios
O encaminhamento resolve o que pagas por tarefa. A pergunta mais difícil é o que compraste com isso, e não a consegues ler na fatura. O custo é só a metade de que as pessoas discutem. A atribuição é a metade que custa mais, sem se dar por isso.
Quando alguém gasta $300 de Opus este mês, a pergunta não é que modelo, é que projeto. Se não sabes responder, cada dólar cai no mesmo balde indiferenciado de despesa operacional e é lançado como gasto no momento em que é gasto. As finanças veem um débito da Anthropic e um número, não o conseguem ligar a uma pessoa nem a um trabalho, e por isso não podem fazer nada com ele senão vê-lo crescer. É uma segunda folha de salários sem centros de custo.
Uma fatura sem contexto é só uma fatura, um número que subiu. Com contexto, torna-se um mapa. Vês que a equipa que constrói o novo fluxo de faturação gasta $40k de tempo de modelo por mês, enquanto uma experiência que ninguém aprovou gasta $60k. Vês que funcionalidades custam mais a lançar do que alguma vez vão render, e quais as baratas que estão a carregar o roteiro. Isso não é cortar custos. É saber onde está a tua alavanca, que trabalho alimentar e qual deixar à fome. A despesa atribuída deixa de ser o número que as finanças temem e passa a ser a leitura mais afiada que tens de onde o valor está a ser criado.
E muda a contabilidade, não só o seu reporte. A despesa de IA que vai para construir software novo pode ser capitalizada e amortizada ao longo da sua vida útil, tal como o desenvolvimento de software tradicional ao abrigo da IAS 38 ou da ASC 350-403. O obstáculo nunca foram as regras contabilísticas. Foi a falta de atribuição. Não podes capitalizar o que não consegues atribuir, e a fatura do fornecedor não atribui nada. O Flowstate liga cada chamada a uma pessoa, a um projeto, a um modelo e a uma classe de custo, para que o trabalho que constrói valor real deixe de se esconder na despesa operacional.
E quanto mais do teu trabalho se qualifica, maior isto fica. Se 70% do teu esforço de desenvolvimento é genuinamente construir produto novo (e para muitas equipas é), a atribuição desloca a maior parte dessa despesa de IA do resultado deste trimestre para o balanço, para ser amortizada ao longo dos anos em que o software rende. Numa fatura de IA de sete dígitos, isso não é arrumação. É a diferença entre um golpe na margem agora e um ativo que recuperas mais tarde. (Se um dado projeto se qualifica é um juízo para a tua equipa de finanças e auditoria, não para um post de blogue.)
Onde entramos
O Flowstate é um proxy inteligente: pensa no Zscaler, mas para tráfego de IA. Não juntamos contas e não guardamos os teus contratos. Manténs as tuas chaves e o teu acordo com cada fornecedor que a tua equipa usa. Ficamos no caminho do pedido e fazemos três coisas a cada chamada à medida que passa: encaminhamo-la para o modelo de que a tarefa realmente precisa, inspecionamo-la à procura do que nunca devia sair (código-fonte, dados pessoais de clientes a seguir para onde não devem) e registamo-la contra uma pessoa, um projeto e uma classe de custo. Essa é a visibilidade que o Enterprise cobra com um prémio, sem o prémio e sem entregar os teus contratos a ninguém.
Como somos um proxy e não um conjunto de contas partilhadas, a tua posição nas condições de um fornecedor continua a ser decisão tua, tomada com o quadro completo à frente e não às escuras. Podes ver o que cada implementação custa de facto, reduzir a despesa com o encaminhamento e abrir ou fechar as torneiras por equipa consoante o risco que estás disposto a assumir. As duas fugas acima são a mesma máquina a fazer dois trabalhos: enviar cada pedido para o modelo certo e tornar a implementação que escolheste legível o bastante para a gerir.
Duas ressalvas, sem rodeios. O Flowstate torna uma implementação observável e controlável. Não reescreve o teu contrato. Se precisas de um BAA, de residência de dados ou de uma cláusula contratual de não treino, essa é a porta Enterprise, e aí o nosso trabalho é o encaminhamento e o registo: impedir que a fatura medida te fuja das mãos. E tudo isto é uma história de utilização intensa: para uma equipa pequena, a fatura medida nunca chega perto do ponto em que isto se paga, como a calculadora mostra no instante em que baixas a utilização.
Durante anos, a escolha pareceu binária: deixar as pessoas pegar em qualquer modelo que tenham à frente e aguentar a fatura, ou trancar tudo e policiar cada prompt à mão.
Não devia ser uma escolha binária entre aguentar a fatura e travar a equipa com limites de utilização. Encaminha a tarefa e deixas de pagar preços de Opus por trabalho de Sonnet. Atribui a despesa e a IA deixa de ser um golpe indiferenciado na margem. Só precisas de um proxy no meio que te dê os controlos.4
Footnotes
-
Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, indicam até 40% menos chamadas ao modelo grande sem queda na qualidade das respostas. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, indicam reduções de custo superiores a 2× em partes do seu teste de referência, sem comprometer a qualidade. Os routers comerciais anunciam mais (40–70%). Modelei com o valor revisto por pares. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩
-
A Anthropic separou as taxas de lugar do Enterprise da utilização de tokens em 2026. Segundo o Claude Help Center, “Usage isn’t included in the seat fee… Every token your team uses, in chat, Claude Code, or Cowork, is billed at standard API rates on top of your seat cost.” Os limites de sessão por lugar variam por nível, com um lugar Team Premium a rondar 6,25× o limite por sessão do Pro. Os lugares de base publicados custam $20 (Team Standard e Enterprise) e $100 (Team Premium). O preço real do Enterprise é negociado com as vendas. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩
-
A IAS 38 Intangible Assets (fase de desenvolvimento) e a ASC 350-40 (software de uso interno) regem quando o custo de desenvolvimento pode ser capitalizado em vez de lançado como gasto. A elegibilidade é uma questão de juízo e de auditoria, não de afirmação. Nada aqui é aconselhamento contabilístico. ↩
-
Cofundei o Flowstate, por isso aplica-se a declaração óbvia de conflito de interesses. Os valores de encaminhamento acima são modelados a partir de preços públicos e da investigação citada, não de uma conta de cliente. ↩