La ley de Moore de la IA ha muerto, oficialmente
En esta página
Google lanzó hoy Gemini 3 Flash. Es su nuevo modelo por defecto en la app de Gemini en todo el mundo y sustituye a Gemini 2.5 Flash.1 Los benchmarks impresionan, porque supera a Gemini 2.5 Pro y es tres veces más rápido.
Pero hay trampa. Es más caro.
Los tokens de entrada pasan de $0,30 a $0,50 por millón. Los de salida, de $2,50 a $3,00. Eso es un 67 % más en entrada y un 20 % más en salida.
Los comentarios de Hacker News ya se han dado cuenta:
They are pushing the prices higher with each release though: API pricing is up to $0.5/M for input and $3/M for output.2
Llevamos años oyendo que los costes de la IA bajan. La ley de Moore de la inferencia. La carrera hacia el fondo. Pero ¿es eso lo que está pasando de verdad?
¿Pasa en todo el mercado?
Respuesta corta: depende de qué modelos mires.
He pasado los últimos días reuniendo el historial de precios de todos los grandes proveedores: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek y Cohere.3 El panorama que sale es más complicado que el relato de que “la IA se está abaratando”.
Lo que estamos viendo es una recuperación en forma de K en los precios de la IA.
Por si el término no te suena, una tendencia “en forma de K” aparece cuando partes distintas del mercado se mueven en direcciones opuestas. Un brazo de la K se dispara hacia arriba y el otro se desploma. En la IA, el coste de la inteligencia en bruto se está partiendo en dos: mientras algunos jugadores de producto básico siguen en la carrera hacia el fondo, los modelos en los que confiamos para el trabajo serio son cada vez más caros. Aunque, siendo sinceros, se parece menos a una K y más a un <: un cocodrilo con la boca abierta de par en par, a punto de zamparse a un fundador de IA.
Te enseño lo que encontré.
Precios de los modelos de frontera a lo largo del tiempo
Primero, los modelos de frontera. Son lo mejor que ofrece cada proveedor, los líderes de investigación que empujan los límites del cómputo. Son los que usarías para razonamiento complejo, flujos agénticos y tareas donde importa más la calidad que el coste.
Precio de entrada ($/1M de tokens)
Precio de salida ($/1M de tokens)
La historia en la frontera es un desorden. El suelo sube. Mientras celebrábamos las bajadas del 80 % de 2024, los modelos de frontera de 2025 llegan con sobreprecio. No pagamos solo por más inteligencia. Pagamos también las enormes facturas de I+D y de energía que por fin han vencido.
OpenAI recortó el precio de GPT-4 un 83 % en 18 meses,4 pero la tendencia se ha invertido con GPT-5 y con unidades especializadas como o1-pro. Anthropic mantuvo Claude Opus en $15/$75 durante casi dos años antes de rebajar Opus 4.5 un 67 %.5 Google se pasó con la tijera en Gemini 1.5 Pro a finales de 2024, para luego subir otra vez los precios de Gemini 3 Pro.
¿Lo único que mantiene vivo el relato de la “carrera hacia el fondo”? DeepSeek. Su V3, a $0,28/$1,10, es 18 veces más barato que GPT-5 y 54 veces más barato que Claude Opus en su punto más alto. Es el aguafiestas: la prueba de que las ganancias de eficiencia son posibles, pero también un caso aislado que los laboratorios occidentales no han igualado.
Precios del nivel de eficiencia a lo largo del tiempo
Los modelos de eficiencia, los caballos de batalla de producción de alto volumen, muestran una divergencia todavía más marcada.
Precio de entrada ($/1M de tokens)
Precio de salida ($/1M de tokens)
Aquí la cosa se pone interesante.
El nivel rápido de OpenAI bajó un 92 % desde GPT-3.5 Turbo ($2/$2) hasta GPT-4o mini ($0,15/$0,60). Ese es el relato que nos han contado.
Pero mira a Anthropic. Claude 3 Haiku salió a $0,25/$1,25 en marzo de 2024. Luego, en noviembre de 2024, llegó Claude 3.5 Haiku a $1,00/$5,00.6 Eso es una subida de precio de 4 veces en el modelo “económico”.
¿Y Google? Gemini 1.5 Flash bajó a $0,075/$0,30 en agosto de 2024. ¿El Gemini 3 Flash de hoy? $0,50/$3,00. Eso es una subida de 6,7 veces en entrada y de 10 veces en salida.
La tendencia del nivel de eficiencia no baja de forma constante. Depende por completo del proveedor que uses.
¿Se corresponde con mejoras reales?
Es una pregunta justa. A lo mejor los precios suben porque los modelos mejoran muchísimo.
Puntuaciones en MMLU a lo largo del tiempo
Puntuaciones en HumanEval a lo largo del tiempo (programación)
Los benchmarks cuentan una historia con matices.
Las puntuaciones en MMLU se han agrupado en torno al 88-92 % en los mejores modelos.7 GPT-4 llegó al 86,4 % en marzo de 2023. GPT-5 llega hoy al 91,4 %. Son 5,8 puntos porcentuales en casi tres años. La distancia entre proveedores se ha reducido a unos pocos puntos.
HumanEval muestra ganancias más espectaculares, del 67 % a más del 92 % en los líderes. Pero, otra vez, los mejores modelos convergen.
Esta es la verdad incómoda: las mejoras en los benchmarks se han frenado mientras algunos precios suben. La curva de precio/rendimiento no es tan favorable como en 2023-2024.
Qué empuja los precios hacia arriba
Hemos tocado un techo de eficiencia en la inferencia.
Ya hemos optimizado lo fácil: caché KV, cuantización, retoques de arquitectura. Para el siguiente salto en razonamiento, ahora le echamos cómputo en bruto al problema durante la inferencia, con iteraciones internas de “cadena de pensamiento”. No puedes optimizar un modelo que tiene que “pensar” 10 segundos antes de contestar.
Otros factores:
- Costes de energía. Los centros de datos compiten por una capacidad eléctrica limitada en todo el mundo. Google, Microsoft y Amazon firman contratos de compra de energía a largo plazo por miles de millones.
- Retorno del capital. Los hiperescalares que gastan $50-100B al año en infraestructura ahora tienen que demostrar rentabilidad a sus inversores. La fase de “conquista de territorio” se acabó.
- Licencias de datos. La era de los datos de entrenamiento gratis se acaba. Las empresas pagan millones por texto humano de calidad.
El efecto aguas abajo: lo “ilimitado” ha muerto
Si los precios de los modelos suben, ¿qué les pasa a los productos construidos encima?
Estamos viendo un giro general hacia precios por uso.
Cursor pasó a créditos por uso en junio de 2025.8 Cuando Claude Opus 4 se quedó en $15/$75, el plan “Pro” de tarifa plana de Cursor se convirtió en una obra de caridad. El cambio no fue una elección, fue una táctica de supervivencia.9 Los usuarios intensivos ahora pagan entre $100 y $200 al mes.
GitHub Copilot introdujo las “premium requests” y empezó a aplicar límites en junio de 2025.10 El 2 de diciembre de 2025 eliminó los presupuestos de $0 heredados en los que se apoyaban muchas cuentas de empresa para bloquear los cargos por exceso.11 Si no has revisado hace poco la configuración de facturación de Copilot, puede que te lleves una sorpresa.
Lovable cambió a deducciones por complejidad en julio de 2025.12 Su documentación ahora avisa: “If you rely heavily on Lovable’s cloud and AI usage, you could burn through credits far faster than you planned.”
El patrón está claro. Todas las grandes herramientas de desarrollo con IA han pasado, o están pasando, de planes “ilimitados” de precio fijo a modelos de consumo. No es avaricia. Es la economía de fondo, que por fin se ha puesto al día.
¿Y la computación cuántica?
Tiene su ironía que Google, la empresa que acaba de subir hasta 10 veces los precios de Gemini Flash, pueda tener también la llave para que la IA vuelva a ser asequible.
Su procesador cuántico Willow y el algoritmo “Quantum Echoes” aseguran un rendimiento 13.000 veces más rápido que el de los superordenadores.1314 La promesa es que el hardware cuántico podría revolucionar las multiplicaciones de matrices que encarecen tanto la inferencia de las redes neuronales.
Pero seamos realistas.
Google nos pide apostar por un futuro cuántico multiuniverso para resolver un problema de precios que ellos han creado en el presente.15 Es la distracción de manual. Hasta que pueda conectar Willow a una API de producción a $0,01/1M de tokens, no es más que relaciones públicas con sabor a física.
Es la empresa que ha matado 293 productos.16 Aunque la inferencia cuántica llegue a ser viable, su historial sugiere que encontrarían la forma de hacerla cara, de encerrarla en su nube o de abandonarla sin más.
El panorama de precios de la IA ya no es una historia sencilla de costes a la baja. Es una bifurcación en forma de K en la que la inteligencia de frontera y los caballos de batalla fiables se encarecen. Si no sigues tu gasto en IA con detalle, te llevarás un susto cuando llegue la factura.
Si esto te suena, quizá sea el momento de hablar con flowstate.
Buena parte de la investigación salió del Internet Archive. Para una parte considerable de este post he tenido que navegar por versiones antiguas de webs. Si te gusta la misión del Internet Archive de preservar la historia digital, plantéate apoyarlos con una donación.
Footnotes
-
Google Gemini 3 Flash announcement (December 2025) ↩
-
Hacker News discussion on Gemini 3 Flash (December 2025) ↩
-
Datos de precios recopilados de la documentación oficial: OpenAI, Anthropic, Google, xAI, Mistral, DeepSeek, Cohere ↩
-
OpenAI API Pricing - precios históricos vía Wayback Machine ↩
-
Claude 3.5 Haiku announcement (November 2024) ↩
-
Cursor pricing changes (June 2025) ↩
-
GitHub Copilot billing changes (December 2025) ↩
-
Google Willow quantum chip announcement (December 2024) ↩
-
Google Quantum Echoes demonstration - Nature (October 2025) ↩
-
Hartmut Neven, fundador de Google Quantum AI, sobre Willow y la hipótesis del multiverso ↩
-
Killed by Google - el cementerio de Google ↩