A Lei de Moore da IA está oficialmente morta
Nesta página
O Google lançou hoje o Gemini 3 Flash. Ele passa a ser o modelo padrão do app Gemini no mundo todo, no lugar do Gemini 2.5 Flash.1 Os benchmarks impressionam: ele supera o Gemini 2.5 Pro e ainda é três vezes mais rápido.
Só que tem um porém. Ele é mais caro.
Os tokens de entrada subiram de $0,30 para $0,50 por milhão. Os de saída foram de $2,50 para $3,00. Isso dá 67% a mais na entrada e 20% na saída.
Os comentários do Hacker News já notaram:
They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2
Faz anos que nos dizem que o custo da IA está caindo. Lei de Moore da inferência. Corrida para o fundo do poço. Mas é isso mesmo que está acontecendo?
Isso vale para todo mundo?
Resposta curta: depende de quais modelos você olha.
Passei os últimos dias juntando o histórico de preços de todos os grandes provedores: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek e Cohere.3 O quadro que sai disso é mais cheio de nuances do que a narrativa de que “a IA está ficando mais barata”.
O que estamos vendo é uma recuperação em formato de K nos preços da IA.
Para quem não conhece o termo, uma tendência “em K” acontece quando partes diferentes do mercado andam em direções opostas: um braço do K dispara para cima enquanto o outro despenca. Na IA, o custo da inteligência bruta está se dividindo. Alguns players de commodity ainda correm para baixo, mas os modelos em que a gente realmente confia para trabalho sério estão cada vez mais caros. Aliás, parece menos um K e mais um <, um crocodilo de boca aberta prestes a engolir um fundador de IA.
Vou mostrar o que encontrei.
Preço dos modelos de fronteira ao longo do tempo
Primeiro, os modelos de fronteira. São o melhor que cada provedor tem a oferecer, os líderes de pesquisa que empurram os limites da computação. É o que você usa para raciocínio complexo, fluxos agênticos e tarefas em que a qualidade pesa mais que o custo.
Preço de entrada ($/1M tokens)
Preço de saída ($/1M tokens)
A história da fronteira é bagunçada. O piso está subindo. Enquanto a gente comemorava as quedas de 80% em 2024, os modelos de fronteira de 2025 chegam com ágio. Não estamos pagando só por mais inteligência. Estamos pagando as contas enormes de P&D e de energia que finalmente venceram.
A OpenAI cortou o preço do GPT-4 em 83% ao longo de 18 meses,4 mas a tendência virou com o GPT-5 e com modelos especializados como o o1-pro. A Anthropic manteve o Claude Opus a $15/$75 por quase dois anos antes de cortar o Opus 4.5 em 67%.5 O Google derrubou o preço do Gemini 1.5 Pro no fim de 2024, só para subir de novo o do Gemini 3 Pro.
A única coisa que mantém viva a narrativa da “corrida para o fundo do poço”? A DeepSeek. O V3 dela, a $0,28/$1,10, custa 18 vezes menos que o GPT-5 e 54 vezes menos que o Claude Opus no auge. Ela é a estraga-prazeres: prova de que ganhos de eficiência são possíveis, mas também um ponto fora da curva que os laboratórios ocidentais não igualaram.
Preço da camada de eficiência ao longo do tempo
Os modelos de eficiência, os cavalos de batalha de produção em alto volume, mostram uma divergência ainda mais gritante.
Preço de entrada ($/1M tokens)
Preço de saída ($/1M tokens)
Aqui a coisa fica interessante.
A camada rápida da OpenAI caiu 92%, do GPT-3.5 Turbo ($2/$2) para o GPT-4o mini ($0,15/$0,60). Essa é a narrativa que nos contaram.
Mas olhe a Anthropic. O Claude 3 Haiku saiu a $0,25/$1,25 em março de 2024. Aí o Claude 3.5 Haiku chegou em novembro de 2024 a $1,00/$5,00.6 É um aumento de 4 vezes no modelo “econômico”.
E o Google? O Gemini 1.5 Flash caiu para $0,075/$0,30 em agosto de 2024. O Gemini 3 Flash de hoje? $0,50/$3,00. É um aumento de 6,7 vezes na entrada e de 10 vezes na saída.
A tendência da camada de eficiência não é de queda constante. Depende inteiramente do provedor que você usa.
Isso se traduz em melhorias reais?
Pergunta justa. Talvez os preços estejam subindo porque os modelos estão ficando muito melhores?
Pontuações de MMLU ao longo do tempo
Pontuações de HumanEval ao longo do tempo (código)
Os benchmarks contam uma história com nuances.
As pontuações de MMLU se agruparam entre 88 e 92% nos melhores modelos.7 O GPT-4 chegou a 86,4% em março de 2023. O GPT-5 chega a 91,4% hoje. São 5,8 pontos percentuais em quase três anos. A distância entre os provedores encolheu para poucos pontos.
O HumanEval mostra ganhos mais dramáticos, de 67% para mais de 92% nos líderes. Mas, de novo, os melhores modelos estão convergindo.
Eis a verdade incômoda: os ganhos nos benchmarks desaceleraram enquanto alguns preços sobem. A curva de preço e desempenho não é tão favorável quanto era em 2023 e 2024.
O que puxa esses aumentos de preço?
Batemos num teto de eficiência da inferência.
Já otimizamos o que era fácil: cache de KV, quantização, ajustes de arquitetura. Para o próximo salto em raciocínio, agora jogamos computação bruta no problema durante a inferência, com as iterações internas de “cadeia de pensamento”. Não dá para otimizar um modelo que precisa “pensar” por 10 segundos antes de responder.
Outros fatores:
- Custo de energia. Os data centers disputam uma capacidade de energia limitada no mundo todo. Google, Microsoft e Amazon estão assinando contratos de compra de energia de longo prazo na casa dos bilhões.
- Retorno do capital. Hyperscalers que gastam $50-100B por ano em infraestrutura agora precisam mostrar lucro aos investidores. A fase da “corrida por território” acabou.
- Licenciamento de dados. A era dos dados de treino de graça está acabando. As empresas pagam milhões por texto humano de qualidade.
Efeito em cadeia: o “ilimitado” morreu
Se os preços dos modelos sobem na origem, o que acontece com os produtos construídos em cima deles?
Estamos vendo uma mudança geral para a cobrança por uso.
O Cursor passou para créditos por uso em junho de 2025.8 Quando o Claude Opus 4 continuou a $15/$75, o plano “Pro” de preço fixo do Cursor virou ato de caridade. A mudança não foi uma escolha, foi tática de sobrevivência.9 Quem usa muito agora paga $100-200 por mês.
O GitHub Copilot lançou as “premium requests” e começou a aplicar limites em junho de 2025.10 Em 2 de dezembro de 2025, removeu os orçamentos de $0 antigos em que muitas contas corporativas confiavam para bloquear cobrança excedente.11 Se você não revisou as configurações de cobrança do Copilot recentemente, pode ter uma surpresa.
A Lovable passou a descontar créditos por complexidade em julho de 2025.12 A documentação deles agora avisa: “If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned.”
O padrão é claro. Toda grande ferramenta de desenvolvimento com IA saiu, ou está saindo, dos planos “ilimitados” de preço fixo para modelos baseados em consumo. Isso não é ganância. É a economia de fundo alcançando a conta.
E a computação quântica?
Há uma certa ironia no fato de que o Google, a empresa que acabou de aumentar em 10 vezes o preço do Gemini Flash, também pode ter a chave para tornar a IA acessível de novo.
O processador quântico Willow e o algoritmo “Quantum Echoes” alegam um desempenho 13.000 vezes mais rápido que o dos supercomputadores.1314 A promessa é que o hardware quântico poderia revolucionar as multiplicações de matrizes que tornam a inferência de redes neurais tão cara.
Mas sejamos realistas.
O Google está pedindo que a gente aposte num futuro quântico de múltiplos universos para resolver um problema de preço que ele criou no presente.15 É um clássico diversionismo. Até eu poder ligar o Willow a uma API de produção a $0,01/1M tokens, isso é só propaganda com sabor de física.
É a empresa que já matou 293 produtos.16 Mesmo que a inferência quântica se torne viável, o histórico dela sugere que daria um jeito de deixá-la cara, prendê-la na própria nuvem ou abandoná-la de vez.
O cenário de preços da IA deixou de ser uma história simples de custos em queda. É uma bifurcação em K, em que a inteligência de fronteira e os cavalos de batalha confiáveis ficam mais caros. Se você não acompanha seu gasto com IA em detalhe, vai ter uma surpresa quando a conta chegar.
Se isso fez sentido para você, talvez seja hora de conversar com a flowstate.
Muita pesquisa foi feita com a ajuda do Internet Archive. Em boa parte deste post, precisei navegar por versões antigas de sites. Se você gosta da missão do Internet Archive de preservar a história digital, pense em apoiá-los com uma doação.
Footnotes
-
Google Gemini 3 Flash announcement (dezembro de 2025) ↩
-
Hacker News discussion on Gemini 3 Flash (dezembro de 2025) ↩
-
Dados de preço compilados da documentação oficial: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩
-
OpenAI API Pricing - histórico de preços via Wayback Machine ↩
-
Claude 3.5 Haiku announcement (novembro de 2024) ↩
-
Cursor pricing changes (junho de 2025) ↩
-
GitHub Copilot billing changes (dezembro de 2025) ↩
-
Google Willow quantum chip announcement (dezembro de 2024) ↩
-
Google Quantum Echoes demonstration - Nature (outubro de 2025) ↩
-
Hartmut Neven, fundador do Google Quantum AI, sobre o Willow e a hipótese do multiverso ↩
-
Killed by Google - o cemitério do Google ↩