← Todos os textos

A Lei de Moore da IA está oficialmente morta

Nesta página

A Google lançou hoje o Gemini 3 Flash. É o novo modelo por omissão da app Gemini a nível global e substitui o Gemini 2.5 Flash.1 Os benchmarks impressionam. Supera o Gemini 2.5 Pro e é três vezes mais rápido.

Mas há um senão. É mais caro.

Os tokens de entrada subiram de 0,30 $ para 0,50 $ por milhão. Os de saída passaram de 2,50 $ para 3,00 $. É uma subida de 67% na entrada e de 20% na saída.

Os comentários no Hacker News já reparam nisso:

They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2

Há anos que nos dizem que os custos da IA estão a cair. A Lei de Moore da inferência. Corrida para o fundo. Mas é mesmo isso que está a acontecer?

Acontece em todo o lado?

Resposta curta: depende dos modelos que olhares.

Passei os últimos dias a juntar o histórico de preços de todos os grandes fornecedores: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek e Cohere.3 O retrato que sai daqui tem mais nuances do que a narrativa de que “a IA está a ficar mais barata”.

O que estamos a ver é uma recuperação em K nos preços da IA.

Para quem não conhece o termo, uma tendência “em K” acontece quando partes diferentes do mercado seguem em sentidos opostos. Um braço do K dispara para cima e o outro afunda. Na IA, o custo da inteligência em bruto está a separar-se: alguns fornecedores de produto indiferenciado continuam a correr para o fundo, mas os modelos em que realmente confiamos para trabalho a sério ficam cada vez mais caros. Para ser sincero, parece menos um K e mais um <, um crocodilo de boca bem aberta, prestes a comer um fundador de IA.

Deixa-me mostrar-te o que encontrei.

Preços dos modelos de fronteira ao longo do tempo

Primeiro, os modelos de fronteira. São o melhor que cada fornecedor tem para oferecer, os líderes de investigação a empurrar os limites do cálculo. São os que usarias para raciocínio complexo, fluxos de trabalho com agentes e tarefas em que a qualidade pesa mais do que o custo.

Preço de entrada ($/1M tokens)

Preço de saída ($/1M tokens)

A história da fronteira é confusa. O piso está a subir. Enquanto celebrávamos as descidas de 80% em 2024, os modelos de fronteira de 2025 chegam com um prémio. Não estamos só a pagar por mais inteligência. Estamos a pagar a enorme fatura de investigação e energia que finalmente chegou.

A OpenAI baixou os preços do GPT-4 em 83% ao longo de 18 meses,4 mas a tendência inverteu-se com o GPT-5 e com unidades especializadas como o o1-pro. A Anthropic manteve o Claude Opus a 15 $/75 $ durante quase dois anos, antes de cortar 67% ao Opus 4.5.5 A Google cortou a eito no Gemini 1.5 Pro no final de 2024, só para voltar a subir os preços do Gemini 3 Pro.

A única coisa que mantém viva a narrativa da “corrida para o fundo”? A DeepSeek. O V3, a 0,28 $/1,10 $, é 18 vezes mais barato do que o GPT-5 e 54 vezes mais barato do que o Claude Opus no auge. É o desmancha-prazeres, a prova de que os ganhos de eficiência são possíveis, mas também um caso isolado que os laboratórios ocidentais não igualaram.

Preços do escalão de eficiência ao longo do tempo

Os modelos de eficiência, os cavalos de batalha de produção para grandes volumes, mostram uma divergência ainda mais acentuada.

Preço de entrada ($/1M tokens)

Preço de saída ($/1M tokens)

Aqui é que a coisa fica interessante.

O escalão rápido da OpenAI caiu 92%, do GPT-3.5 Turbo (2 $/2 $) para o GPT-4o mini (0,15 $/0,60 $). É essa a narrativa que nos contam.

Mas olha para a Anthropic. O Claude 3 Haiku chegou em março de 2024 a 0,25 $/1,25 $. Depois, em novembro de 2024, veio o Claude 3.5 Haiku a 1,00 $/5,00 $.6 É uma subida de 4 vezes no preço do modelo “económico”.

E a Google? O Gemini 1.5 Flash desceu para 0,075 $/0,30 $ em agosto de 2024. O Gemini 3 Flash de hoje? 0,50 $/3,00 $. É uma subida de 6,7 vezes na entrada e de 10 vezes na saída.

A tendência do escalão de eficiência não é de descida consistente. Depende por inteiro do fornecedor que usas.

Isto corresponde a melhorias reais?

Pergunta justa. Talvez os preços estejam a subir porque os modelos estão muito melhores?

Pontuações no MMLU ao longo do tempo

Pontuações no HumanEval ao longo do tempo (programação)

Os benchmarks contam uma história com nuances.

As pontuações no MMLU concentraram-se entre 88 e 92% nos melhores modelos.7 O GPT-4 atingiu 86,4% em março de 2023. O GPT-5 atinge hoje 91,4%. São 5,8 pontos percentuais em quase três anos. A diferença entre fornecedores encolheu para poucos pontos.

O HumanEval mostra ganhos mais dramáticos, de 67% para mais de 92% nos líderes. Mas, outra vez, os melhores modelos estão a convergir.

Esta é a verdade incómoda: as melhorias nos benchmarks abrandaram enquanto alguns preços sobem. A curva preço/desempenho já não é tão favorável como em 2023-2024.

O que está por trás destas subidas de preço?

Chegámos a um teto de eficiência na inferência.

Já otimizámos o que era fácil: cache de KV, quantização, ajustes de arquitetura. Para o salto seguinte em raciocínio, estamos agora a atirar cálculo em bruto ao problema durante a inferência, com iterações internas de “cadeia de pensamento”. Não há otimização que safe um modelo que tem de “pensar” durante 10 segundos antes de responder.

Outros fatores:

  • Custos de energia. Os centros de dados disputam uma capacidade elétrica limitada em todo o mundo. A Google, a Microsoft e a Amazon assinam contratos de compra de energia de longo prazo que valem milhares de milhões.
  • Retorno do capital. Os hyperscalers que gastam 50 a 100 mil milhões de dólares por ano em infraestrutura precisam agora de provar rentabilidade aos investidores. A fase da “corrida à terra” acabou.
  • Licenciamento de dados. A era dos dados de treino gratuitos está a acabar. As empresas pagam milhões por texto humano de qualidade.

O efeito a jusante: o “ilimitado” morreu

Se os preços dos modelos a montante sobem, o que acontece aos produtos construídos em cima deles?

Estamos a assistir a uma mudança generalizada para preços baseados no uso.

O Cursor passou para créditos baseados no uso em junho de 2025.8 Com o Claude Opus 4 a manter-se a 15 $/75 $, o plano “Pro” de preço fixo do Cursor tornou-se um ato de caridade. A mudança não foi uma escolha. Foi uma tática de sobrevivência.9 Os utilizadores intensivos pagam agora 100 a 200 $ por mês.

O GitHub Copilot introduziu os “pedidos premium” e começou a impor limites em junho de 2025.10 A 2 de dezembro de 2025, removeu os orçamentos legados de 0 $ em que muitas contas empresariais se apoiavam para bloquear cobranças em excesso.11 Se não reviste recentemente as definições de faturação do Copilot, podes ter uma surpresa.

A Lovable passou para deduções baseadas na complexidade em julho de 2025.12 A documentação deles avisa agora: “If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned.”

O padrão é claro. Todas as grandes ferramentas de desenvolvimento com IA passaram, ou estão a passar, de planos “ilimitados” de preço fixo para modelos de consumo. Isto não é ganância. É a economia de fundo a ajustar contas.

E a computação quântica?

Há uma certa ironia no facto de a Google, a empresa que acabou de subir os preços do Gemini Flash em 10 vezes, poder também deter a chave para tornar a IA acessível outra vez.

O processador quântico Willow e o algoritmo “Quantum Echoes” garantem um desempenho 13 000 vezes mais rápido do que os supercomputadores.1314 A promessa é que o hardware quântico poderia revolucionar as multiplicações de matrizes que tornam a inferência de redes neuronais tão cara.

Mas sejamos realistas.

A Google pede-nos que apostemos num futuro quântico de multiverso para resolver um problema de preços que ela própria criou no presente.15 É um desvio clássico. Até eu poder ligar o Willow a uma API de produção a 0,01 $/1M tokens, é só relações públicas com sabor a física.

É a empresa que já matou 293 produtos.16 Mesmo que a inferência quântica se torne viável, o historial dela sugere que arranjaria maneira de a tornar cara, de a prender à sua cloud ou de a abandonar de vez.

O panorama de preços da IA já não é uma história simples de custos a cair. É uma bifurcação em K em que a inteligência de fronteira e os cavalos de batalha fiáveis ficam mais caros. Se não acompanhas os teus gastos com IA ao pormenor, vais ter uma surpresa quando a fatura chegar.

Se isto te diz alguma coisa, talvez seja altura de falar com a flowstate.


Muita da investigação foi feita com a ajuda do Internet Archive. Em boa parte deste artigo, tive de consultar versões antigas de sites. Se gostas da missão do Internet Archive de preservar a história digital, considera apoiá-lo com um donativo.

Footnotes

  1. Google Gemini 3 Flash announcement (December 2025) ↩

  2. Hacker News discussion on Gemini 3 Flash (December 2025) ↩

  3. Pricing data compiled from official documentation: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩

  4. OpenAI API Pricing - historical pricing via Wayback Machine ↩

  5. Anthropic Claude Pricing ↩

  6. Claude 3.5 Haiku announcement (November 2024) ↩

  7. Stanford HAI: 2025 AI Index Report ↩

  8. Cursor pricing changes (June 2025) ↩

  9. TechCrunch: Cursor apologizes for unclear pricing changes ↩

  10. GitHub Copilot premium requests documentation ↩

  11. GitHub Copilot billing changes (December 2025) ↩

  12. Lovable pricing and credits ↩

  13. Google Willow quantum chip announcement (December 2024) ↩

  14. Google Quantum Echoes demonstration - Nature (October 2025) ↩

  15. Hartmut Neven, founder of Google Quantum AI, on Willow and the multiverse hypothesis ↩

  16. Killed by Google - the Google graveyard ↩