Cómo escapar de la trampa del coste de la IA
En esta página
Hacía tiempo que no escribía nada. Me he cogido dos semanas libres en el sur de Francia con familia y amigos, y los debates de sobremesa han vuelto una y otra vez a la IA: su complejidad, su potencial y los problemas enormes de cómo se financia.
La IA sale barata para los usuarios finales ahora mismo, pero solo porque el capital riesgo paga la cuenta. La realidad es que entrenar y ejecutar modelos sigue siendo caro, y alguien tiene que pagarlo. Por ahora, ese “alguien” son los inversores. Pero los precios no se quedarán bajos para siempre. Las cuentas, sencillamente, no salen.
Las subvenciones no son sostenibles
Los miles de millones que han levantado OpenAI, Anthropic, Mistral y otras se van en cómputo, personal y GPUs de Nvidia. Los consumidores ven precios subvencionados, pero los costes de fondo son enormes. El flujo de caja es más o menos así:
- Los fondos de capital riesgo y los inversores privados meten miles de millones en los proveedores de modelos.
- Los proveedores de modelos (OpenAI, Anthropic, Mistral) gastan después a manos llenas en créditos de nube.
- Los proveedores de nube (Microsoft, Amazon, Google) trasladan ese gasto a su infraestructura.
- Esa infraestructura se reduce, al final, a GPUs, centros de datos, energía y personal.
- Nvidia anota trimestres récord y es la ganadora de verdad.
Es una cadenita perfecta de “goteo hacia abajo”, solo que en vez de que la economía levante todos los barcos, lo que levanta es la cotización de Nvidia. El parecido con los primeros tiempos de los VTC (por ejemplo, Uber) es inquietante: un crecimiento alimentado por capital barato y no por una economía unitaria sana12.
Estrategias distintas: Howie contra Jamie
Algunos competidores de mi producto, Jamie, como Howie, se apoyan en la revisión con humanos en el circuito. Según un podcast reciente, tienen más de 60 empleados cuyo trabajo es revisar a mano los resultados de las simulaciones. Es una forma de garantizar la calidad, pero plantea dudas de escalabilidad.
Con Jamie hemos tomado otro camino. Hoy usamos Claude Sonnet 4 y GPT-5 en producción. Sonnet es nuestro modelo principal (aunque a veces es desesperantemente poco fiable) y GPT-5 es el de reserva. Los dos dan buenos resultados.
Pero no externalizamos la confianza en personas. En su lugar, ejecutamos varios modelos en paralelo para validar los resultados y repetimos hasta que la respuesta es fiable. Confiamos en los modelos y en nuestros clientes para corregir cuando haga falta, en vez de delegar la confianza en un gran equipo de revisión manual.
También guardamos metadatos de cada intercambio. Más tarde, esos fragmentos se recuperan y se cosen al contexto para enriquecer las respuestas. Así el asistente no solo recuerda hechos, sino que puede reutilizar matices, como una pista sobre la zona horaria o un detalle dicho de pasada, para construir las mejores respuestas posibles.
Quién cobra de verdad
Seas Howie, Jamie o un proveedor de modelos, el dinero fluye igual:
Dólares de capital riesgo → proveedores de modelos → proveedores de nube → GPUs, centros de datos y talento.
Nvidia domina el sector, con hasta el 95% del mercado de GPUs para IA3. Cada dólar de una startup acaba en sus resultados trimestrales.
Ser dueño de tu cómputo base
Esta es la jugada estratégica: sé dueño de tu base y sube a la nube solo cuando no te quede otra.
- Cómputo base: hardware de larga vida en colocation o incluso en oficinas. Amortizado a 3–5 años, da una base de costes estable y predecible. Las cargas de IA muchas veces no necesitan los SSD más rápidos. Lo que limita son los ciclos de GPU.
- Cómputo para picos: la nube para picos de demanda, experimentos y elasticidad.
Este enfoque híbrido te protege de la subida de los precios de inferencia en la nube y te deja flexibilidad donde importa.
Por qué volvemos a mirar el hardware
El código abierto ha cambiado la ecuación. LLaMA 3 de Meta se acerca a GPT-5 en los benchmarks, y hemos probado LLaMA y Mistral directamente contra nuestros resultados de Claude y GPT-5. Rinden igual de bien45. Es una salida clara.
En un Mac Studio (M2 Ultra, 192 GB de RAM, 1 TB de SSD) podemos ejecutar inferencia de LLaMA a velocidades prácticas. Apila 20 de estos en una oficina y tendrás un rendimiento sostenido serio por una fracción del coste de la inferencia en la nube.
Comparación rápida de costes: Mac Studio contra OpenAI
Mac Studio (M2 Ultra, 192 GB de RAM, 1 TB de SSD)
- Coste por unidad (2025): ≈$7000 USD (≈£5400)
- 20 unidades: ≈$140.000 USD (≈£109.000)
- Vida útil: ~2–3 años (prudente para cargas de aprendizaje automático)6
Gasto equivalente en OpenAI/Anthropic
- Precio de GPT-5 (sept. 2025): $1,25 por millón de tokens de entrada, $10 por millón de tokens de salida7
- Precio de Claude Sonnet 4: $3 por millón de tokens de entrada, $15 por millón de tokens de salida8
- Un producto de escala media que mueve ~500M de tokens al mes (muy modesto para asistentes a escala) = ≈$14.625 al mes entre el uso de GPT-5 y Claude Sonnet 4
- 2 años = ≈$351.000 (≈£273.000)
Eso es casi 3 veces el coste de comprar y operar tu propio hardware. Y la brecha crece con la escala.
El desenlace probable para nosotros
Salvo que la eficiencia de los modelos mejore de forma radical, los precios subirán cuando se acaben las subvenciones del capital riesgo. Pero ya hemos comprobado que el código abierto puede igualar los resultados de los modelos de frontera.
Por eso el desenlace probable para nosotros es sencillo:
- Dejar de depender de Claude y GPT-5
- Adoptar LLaMA y modelos abiertos entrenados o ajustados por nosotros
- Anclar los costes con hardware base y subir a la nube solo cuando haga falta
El futuro de la IA no será solo de quien tenga más capital. Será de quien monte stacks inteligentes y eficientes.
Footnotes
-
Sequoia Capital, Generative AI: A Creative New World, 2022. Link ↩
-
Reuters, Dominant AI trade confronts test as bellwether Nvidia reports earnings, 2025. Link ↩
-
Meta AI, “Introducing Meta Llama 3”, Apr 18, 2024. https://ai.meta.com/blog/meta-llama-3/ ↩
-
Mistral, “Mistral Large / Mixtral benchmarks” (official model page), Feb 2024, y el Hugging Face Open LLM Leaderboard (evaluaciones comparativas públicas). https://mistral.ai/news/mistral-large https://huggingface.co/open-llm-leaderboard ↩
-
Apple, Mac Studio (M2 Ultra) Pricing and Configurations, 2023–2025. Link ↩