Como escapar da armadilha de custo da IA
Nesta página
Faz tempo que não escrevo nada. Vou tirar duas semanas de folga no sul da França, com a família e amigos, e as conversas na mesa do jantar voltam sempre para a IA: a complexidade dela, o potencial e os problemas enormes de como ela é financiada.
A IA está barata para o usuário final agora, mas só porque o capital de risco está pagando a conta. Treinar e rodar inferência continuam caros, e alguém precisa pagar por isso. Por enquanto, esse “alguém” são os investidores. Mas os preços não vão ficar baixos para sempre. A conta simplesmente não fecha.
Subsídio não dura
Os bilhões captados por OpenAI, Anthropic, Mistral e outras vão para computação, gente e GPUs da Nvidia. O consumidor vê preços subsidiados, mas os custos por trás são enormes. O fluxo do dinheiro é mais ou menos este:
- VCs / investidores privados despejam bilhões nos provedores de modelos.
- Provedores de modelos (OpenAI, Anthropic, Mistral) gastam pesado em créditos de nuvem.
- Provedores de nuvem (Microsoft, Amazon, Google) repassam esse gasto para a infraestrutura deles.
- Essa infraestrutura, no fim das contas, se resume a GPUs, data centers, energia e gente.
- Nvidia registra trimestres recordes e fica com o prêmio.
Uma bela corrente de trickle-down. Só que, em vez de a maré levantar todos os barcos, quem sobe é a ação da Nvidia. A semelhança com o começo dos apps de transporte (por exemplo, a Uber) é assustadora: crescimento movido a capital barato, não a uma boa economia por unidade12.
Estratégias diferentes: Howie e Jamie
Alguns concorrentes do meu produto, o Jamie, como a Howie, apostam em revisão com humano no circuito. Segundo um podcast recente, eles têm mais de 60 pessoas cuidando de conferir à mão os resultados das simulações. É um jeito de garantir qualidade, mas levanta dúvidas sobre escala.
Com o Jamie fomos por outro caminho. Hoje usamos Claude Sonnet 4 e GPT-5 em produção. O Sonnet é o modelo principal (embora seja irritantemente instável às vezes) e o GPT-5 é o reserva. Os dois entregam bons resultados.
Mas a gente não terceiriza a confiança para pessoas. Rodamos vários modelos em paralelo para validar as saídas e repetimos até a resposta ficar confiável. Confiamos nos modelos e nos nossos clientes, que corrigem quando precisa, em vez de passar essa confiança para um time grande de revisão manual.
Também guardamos metadados de cada troca. Esses fragmentos depois voltam à tona e são costurados no contexto para enriquecer as respostas. Assim o assistente não só lembra fatos, como reaproveita nuances, tipo uma dica de fuso horário ou um detalhe solto, para montar a melhor resposta possível.
Quem está recebendo de verdade
Seja você o Howie, o Jamie ou um provedor de modelos, o dinheiro corre do mesmo jeito:
Dólares de VC → provedores de modelos → provedores de nuvem → GPUs, data centers e talento.
A Nvidia domina esse mercado, com até 95% das GPUs de IA3. Todo dólar de startup acaba nos balanços trimestrais dela.
Ser dono da sua capacidade de base
Aqui vai a jogada estratégica: seja dono da sua base e transborde para a nuvem só quando precisar.
- Computação de base: hardware de longa vida em colocation ou até no escritório. Amortizado em 3–5 anos, dá uma base de custo estável e previsível. Cargas de IA muitas vezes não precisam dos SSDs mais rápidos. O gargalo são os ciclos de GPU.
- Computação para picos: a nuvem para picos, experimentos e elasticidade.
Essa abordagem híbrida protege você da alta nos preços de inferência na nuvem e mantém flexibilidade onde ela importa.
Por que estamos voltando a olhar para hardware
O código aberto mudou a conta. O LLaMA 3 da Meta chega perto do GPT-5 nos benchmarks, e testamos LLaMA e Mistral direto contra as nossas saídas de Claude e GPT-5. Eles se saem igualmente bem45. É uma saída clara.
Num Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB) dá para rodar inferência de LLaMA numa velocidade prática. Coloque 20 deles num escritório e você tem vazão sólida e contínua por uma fração do custo da inferência na nuvem.
Comparação rápida de custo: Mac Studio contra OpenAI
Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB)
- Custo por unidade (2025): ≈$7.000 USD (≈£5.400)
- 20 unidades: ≈$140.000 USD (≈£109.000)
- Vida útil: ~2–3 anos (conservador para cargas de ML)6
Gasto equivalente com OpenAI/Anthropic
- Preço do GPT-5 (set. 2025): $1,25 por milhão de tokens de entrada, $10 por milhão de tokens de saída7
- Preço do Claude Sonnet 4: $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída8
- Um produto de porte médio rodando ~500M tokens por mês (bem modesto para assistentes em escala) = ≈$14.625/mês somando GPT-5 + Claude Sonnet 4
- 2 anos = ≈$351.000 (≈£273.000)
É quase 3x o custo de comprar e operar o seu próprio hardware. E a diferença cresce com a escala.
O desfecho provável para a gente
A menos que a eficiência dos modelos melhore radicalmente, os preços vão subir quando o subsídio dos VCs acabar. Mas já provamos que o código aberto consegue igualar as saídas dos modelos de fronteira.
Por isso o desfecho provável para a gente é simples:
- Sair da dependência de Claude e GPT-5
- Adotar LLaMA e modelos abertos treinados ou ajustados por nós
- Ancorar os custos em hardware de base, transbordando para a nuvem só quando precisar
O futuro da IA não vai pertencer só a quem tem mais capital. Vai pertencer a quem montar stacks inteligentes e eficientes.
Footnotes
-
Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩
-
Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩
-
Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩
-
Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩
-
Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩