Escapar à armadilha do custo da IA
Nesta página
Já passou algum tempo desde a última vez que escrevi. Estou duas semanas de folga no sul de França, com família e amigos, e os debates à mesa do jantar voltaram uma e outra vez à IA: a complexidade, o potencial e os problemas enormes de como é financiada.
A IA está barata para os utilizadores finais neste momento, mas só porque o capital de risco paga a conta. A realidade é que treinar e executar modelos continua a ser caro, e alguém tem de pagar. Por agora, esse “alguém” são os investidores. Mas os preços não vão ficar baixos para sempre. As contas simplesmente não batem certo.
Os subsídios não são sustentáveis
Os milhares de milhões levantados pela OpenAI, pela Anthropic, pela Mistral e outras vão para computação, pessoal e GPUs da Nvidia. Os consumidores veem preços subsidiados, mas os custos de fundo são enormes. O fluxo de dinheiro é mais ou menos este:
- Capitais de risco / investidores privados injetam milhares de milhões nos fornecedores de modelos.
- Os fornecedores de modelos (OpenAI, Anthropic, Mistral) gastam depois forte em créditos de cloud.
- Os fornecedores de cloud (Microsoft, Amazon, Google) passam essa despesa para a infraestrutura.
- Essa infraestrutura reduz-se, no fim, a GPUs, centros de dados, energia e pessoal.
- A Nvidia regista trimestres recorde e fica com o prémio.
É uma pequena cadeia perfeita de “o dinheiro escorre para baixo”, só que em vez de a economia levantar todos os barcos, quem sobe é a cotação da Nvidia. A semelhança com os primeiros tempos dos transportes por aplicação (a Uber, por exemplo) é espantosa: crescimento alimentado por capital barato, não por margens unitárias saudáveis12.
Estratégias diferentes: Howie contra Jamie
Alguns concorrentes do meu produto, o Jamie, como o Howie, apoiam-se em revisão humana no circuito. Segundo um podcast recente, têm mais de 60 pessoas cujo trabalho é verificar à mão os resultados das simulações. É uma forma de garantir qualidade, mas levanta dúvidas sobre a escalabilidade.
Com o Jamie seguimos outro caminho. Hoje usamos o Claude Sonnet 4 e o GPT-5 em produção. O Sonnet é o nosso modelo principal (embora seja frustrantemente instável às vezes) e o GPT-5 é o de reserva. Ambos dão bons resultados.
Mas não entregamos a confiança a humanos. Em vez disso, corremos vários modelos em paralelo para validar os resultados, repetindo até a resposta ser fiável. Confiamos nos modelos e nos nossos clientes para corrigir quando for preciso, em vez de entregar a confiança a uma grande equipa de revisão manual.
Guardamos também metadados de cada troca. Mais tarde, esses fragmentos são recuperados e cosidos ao contexto para enriquecer as respostas. Isto quer dizer que o assistente não se limita a lembrar factos, consegue reaproveitar nuances, como pistas sobre o fuso horário ou detalhes ditos de passagem, para construir as melhores respostas possíveis.
Quem é que está mesmo a receber?
Sejas o Howie, o Jamie ou um fornecedor de modelos, o dinheiro corre da mesma maneira:
Dólares de capital de risco → fornecedores de modelos → fornecedores de cloud → GPUs, centros de dados e talento.
A Nvidia domina isto, controlando até 95% do mercado de GPUs para IA3. Cada dólar de uma startup acaba nos resultados trimestrais dela.
Ser dono da tua computação de base
Esta é a jogada estratégica: sê dono da tua base e vai buscar capacidade à cloud quando tiveres de ser.
- Computação de base: hardware de longa duração em colocation ou até nos escritórios. Amortizado ao longo de 3–5 anos, dá uma base de custos estável e previsível. As cargas de IA muitas vezes não precisam dos SSDs mais rápidos. Os ciclos de GPU é que são o fator limitante.
- Computação em rajada: cloud para picos, experimentação e elasticidade.
Esta abordagem híbrida protege-te da subida dos preços de inferência na cloud e mantém a flexibilidade onde ela importa.
Porque estamos a explorar hardware outra vez
O código aberto mudou a equação. O LLaMA 3 da Meta tem resultados próximos do GPT-5 em testes de referência, e testámos o LLaMA e o Mistral diretamente contra os resultados do nosso Claude e do GPT-5. Têm um desempenho igualmente bom45. É uma saída clara.
Num Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB) conseguimos correr inferência do LLaMA a velocidades práticas. Empilha 20 destes num escritório e tens um débito sério e sustentado por uma fração do custo da inferência na cloud.
Comparação rápida de custos: Mac Studio contra OpenAI
Mac Studio (M2 Ultra, 192 GB de RAM, SSD de 1 TB)
- Custo por unidade (2025): ≈$7 000 USD (≈£5 400)
- 20 unidades: ≈$140 000 USD (≈£109 000)
- Vida útil: ~2–3 anos (conservador para cargas de ML)6
Gasto equivalente com OpenAI/Anthropic
- Preços do GPT-5 (set. 2025): $1,25 por milhão de tokens de entrada, $10 por milhão de tokens de saída7
- Preços do Claude Sonnet 4: $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída8
- Um produto de escala média a correr ~500M de tokens por mês (muito modesto para assistentes à escala) = ≈$14 625 por mês entre o uso do GPT-5 e do Claude Sonnet 4
- 2 anos = ≈$351 000 (≈£273 000)
É quase 3 vezes o custo de comprar e operar o teu próprio hardware. E a diferença aumenta com a escala.
O desfecho provável para nós
A menos que a eficiência dos modelos melhore radicalmente, os preços vão subir quando os subsídios do capital de risco acabarem. Mas já provámos que o código aberto consegue igualar os resultados de ponta.
Por isso o desfecho provável para nós é simples:
- Deixar de depender do Claude e do GPT-5
- Adotar o LLaMA e modelos abertos treinados ou ajustados por nós
- Ancorar os custos em hardware de base e recorrer à cloud só quando for preciso
O futuro da IA não vai pertencer só a quem tem mais capital. Vai pertencer a quem construir stacks inteligentes e eficientes.
Footnotes
-
Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩
-
Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩
-
Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩
-
Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024; and the Hugging Face Open LLM Leaderboard (public comparative evaluations). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩
-
Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩