← Todos os textos

Como escapar da armadilha de custo da IA

Nesta página

Faz tempo que não escrevo nada. Vou tirar duas semanas de folga no sul da França, com a família e amigos, e as conversas na mesa do jantar voltam sempre para a IA: a complexidade dela, o potencial e os problemas enormes de como ela é financiada.

A IA está barata para o usuário final agora, mas só porque o capital de risco está pagando a conta. Treinar e rodar inferência continuam caros, e alguém precisa pagar por isso. Por enquanto, esse “alguém” são os investidores. Mas os preços não vão ficar baixos para sempre. A conta simplesmente não fecha.

Subsídio não dura

Os bilhões captados por OpenAI, Anthropic, Mistral e outras vão para computação, gente e GPUs da Nvidia. O consumidor vê preços subsidiados, mas os custos por trás são enormes. O fluxo do dinheiro é mais ou menos este:

  1. VCs / investidores privados despejam bilhões nos provedores de modelos.
  2. Provedores de modelos (OpenAI, Anthropic, Mistral) gastam pesado em créditos de nuvem.
  3. Provedores de nuvem (Microsoft, Amazon, Google) repassam esse gasto para a infraestrutura deles.
  4. Essa infraestrutura, no fim das contas, se resume a GPUs, data centers, energia e gente.
  5. Nvidia registra trimestres recordes e fica com o prêmio.

Uma bela corrente de trickle-down. Só que, em vez de a maré levantar todos os barcos, quem sobe é a ação da Nvidia. A semelhança com o começo dos apps de transporte (por exemplo, a Uber) é assustadora: crescimento movido a capital barato, não a uma boa economia por unidade12.

Estratégias diferentes: Howie e Jamie

Alguns concorrentes do meu produto, o Jamie, como a Howie, apostam em revisão com humano no circuito. Segundo um podcast recente, eles têm mais de 60 pessoas cuidando de conferir à mão os resultados das simulações. É um jeito de garantir qualidade, mas levanta dúvidas sobre escala.

Com o Jamie fomos por outro caminho. Hoje usamos Claude Sonnet 4 e GPT-5 em produção. O Sonnet é o modelo principal (embora seja irritantemente instável às vezes) e o GPT-5 é o reserva. Os dois entregam bons resultados.

Mas a gente não terceiriza a confiança para pessoas. Rodamos vários modelos em paralelo para validar as saídas e repetimos até a resposta ficar confiável. Confiamos nos modelos e nos nossos clientes, que corrigem quando precisa, em vez de passar essa confiança para um time grande de revisão manual.

Também guardamos metadados de cada troca. Esses fragmentos depois voltam à tona e são costurados no contexto para enriquecer as respostas. Assim o assistente não só lembra fatos, como reaproveita nuances, tipo uma dica de fuso horário ou um detalhe solto, para montar a melhor resposta possível.

Quem está recebendo de verdade

Seja você o Howie, o Jamie ou um provedor de modelos, o dinheiro corre do mesmo jeito:

Dólares de VC → provedores de modelos → provedores de nuvem → GPUs, data centers e talento.

A Nvidia domina esse mercado, com até 95% das GPUs de IA3. Todo dólar de startup acaba nos balanços trimestrais dela.

Ser dono da sua capacidade de base

Aqui vai a jogada estratégica: seja dono da sua base e transborde para a nuvem só quando precisar.

  • Computação de base: hardware de longa vida em colocation ou até no escritório. Amortizado em 3–5 anos, dá uma base de custo estável e previsível. Cargas de IA muitas vezes não precisam dos SSDs mais rápidos. O gargalo são os ciclos de GPU.
  • Computação para picos: a nuvem para picos, experimentos e elasticidade.

Essa abordagem híbrida protege você da alta nos preços de inferência na nuvem e mantém flexibilidade onde ela importa.

Por que estamos voltando a olhar para hardware

O código aberto mudou a conta. O LLaMA 3 da Meta chega perto do GPT-5 nos benchmarks, e testamos LLaMA e Mistral direto contra as nossas saídas de Claude e GPT-5. Eles se saem igualmente bem45. É uma saída clara.

Num Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB) dá para rodar inferência de LLaMA numa velocidade prática. Coloque 20 deles num escritório e você tem vazão sólida e contínua por uma fração do custo da inferência na nuvem.


Comparação rápida de custo: Mac Studio contra OpenAI

Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB)

  • Custo por unidade (2025): ≈$7.000 USD (≈£5.400)
  • 20 unidades: ≈$140.000 USD (≈£109.000)
  • Vida útil: ~2–3 anos (conservador para cargas de ML)6

Gasto equivalente com OpenAI/Anthropic

  • Preço do GPT-5 (set. 2025): $1,25 por milhão de tokens de entrada, $10 por milhão de tokens de saída7
  • Preço do Claude Sonnet 4: $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída8
  • Um produto de porte médio rodando ~500M tokens por mês (bem modesto para assistentes em escala) = ≈$14.625/mês somando GPT-5 + Claude Sonnet 4
  • 2 anos = ≈$351.000 (≈£273.000)

É quase 3x o custo de comprar e operar o seu próprio hardware. E a diferença cresce com a escala.


O desfecho provável para a gente

A menos que a eficiência dos modelos melhore radicalmente, os preços vão subir quando o subsídio dos VCs acabar. Mas já provamos que o código aberto consegue igualar as saídas dos modelos de fronteira.

Por isso o desfecho provável para a gente é simples:

  • Sair da dependência de Claude e GPT-5
  • Adotar LLaMA e modelos abertos treinados ou ajustados por nós
  • Ancorar os custos em hardware de base, transbordando para a nuvem só quando precisar

O futuro da IA não vai pertencer só a quem tem mais capital. Vai pertencer a quem montar stacks inteligentes e eficientes.


Footnotes

  1. Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩

  2. Sequoia Capital, Generative AI’s Act Two, 2023. Link ↩

  3. Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩

  4. Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩

  5. Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩

  6. Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩

  7. OpenAI, GPT-5 pricing, 2025. Link ↩

  8. Claude, Claude 4 and Claude Sonnet pricing, 2025. Link ↩