← Todos los artículos

Convierte una factura de IA de 3 M$ en 1,9 M$

En esta página

Ahora mismo, alguien de tu equipo está usando el modelo de IA más caro para editar una presentación. No lo eligió. Es el que viene por defecto. Repite esa elección invisible unos miles de veces al día y tu factura de IA no tardará en parecerse a una nómina.

Dos cosas inflan esa cifra. El modelo por defecto es el equivocado para la tarea: precios de modelo estrella para un trabajo que uno más barato resolvería sin problema. Y la tarea es invisible en la factura, una suma única sin forma de saber en qué proyecto ni en qué modelo se fue.

Flowstate se coloca en la ruta de las peticiones para cerrar las dos fugas. Enrutamos cada prompt al modelo que la tarea necesita de verdad y atamos cada dólar al trabajo que pagó. Nadie entrega menos: el mismo resultado que te costaba 3 M$ ahora cuesta 1,9 M$, y por primera vez puedes ver qué trabajo compró en realidad ese dinero.

Pagas precio de Opus por trabajo de Sonnet

Casi nadie elige un modelo. Usan el que esté seleccionado cuando carga la caja de texto, y el que viene por defecto es el modelo estrella: el más caro de la oferta. Es la decisión correcta para un problema difícil de verdad y puro desperdicio para un correo de una línea. No puedes esperar que alguien de marketing sepa que su ventana de chat por defecto cuesta cinco veces más de lo necesario. El precio no sale en pantalla, y el proveedor no tiene ningún incentivo para enseñarlo.

Así que no les hagas aprenderlo. Que elija el modelo la tarea, no la persona que teclea, y que esa decisión viva en la capa de peticiones y no en la cabeza de nadie. Un resumen o un cambio de formato va a Haiku, la programación y la redacción de todos los días a Sonnet, el razonamiento realmente difícil a Opus. Incluso puedes partir un mismo trabajo: planificarlo en Opus y ejecutarlo en Sonnet, reservando el pensamiento caro para los pasos que lo necesitan. La persona, haga lo que haga todo el día, escribe el mismo prompt y recibe la misma respuesta. La factura es simplemente más pequeña. Y esto va mucho más allá de Claude Code: el mismo valor por defecto está delante de cada chat que abren también tus equipos de ventas, operaciones y marketing.

¿Cuánto más pequeña? La investigación revisada por pares, como el Hybrid LLM de Ding et al., muestra que puedes reducir hasta un 40 % las llamadas al modelo caro sin una caída medible de calidad1. Es aritmética sobre tu mezcla de modelos, y funciona con cualquier despliegue que uses legítimamente.

Esta es la palanca que crece con el uso: cuanto más se apoye tu equipo en la IA, más te cuesta un modelo por defecto equivocado y más te devuelve el enrutamiento. En la calculadora de abajo es la distancia entre tu línea gruesa y la verde.

La factura que no puedes ver

Es el primer día. Un ingeniero entra en una empresa, le dan una cuenta Enterprise de Claude y se funde 145 $ en sus cinco primeros prompts. En un plan de tarifa plana ese uso le habría durado toda la semana. En un plan Enterprise medido, se esfuma antes de comer. Recursos Humanos ya le hace preguntas que no sabe contestar, y él echa cuentas de un mes de 5000 $: “más que mi sueldo”. Donde la página de uso debería mostrar un límite, muestra una sola palabra: Unlimited. Es un post real de r/ClaudeCode, y es la segunda fuga en una sola captura de pantalla.

La primera fuga era el modelo que nadie eligió. Esta es la otra: el contador que nadie mira. Desde este año, Enterprise cobra cada token que gasta tu equipo en el chat, en Claude Code y en Cowork, a tarifas estándar de API además del puesto2. (Teams mantiene un puesto de tarifa plana con una asignación incluida.) El precio medido es barato para un equipo pequeño, pero a escala se te escapa de las manos, y como llega en una única factura sin desglose, nadie detecta el pico hasta que finanzas da la voz de alarma. No puedes enrutar lo que no ves, y no puedes elegir entre dos despliegues que nunca has comparado. Así que compáralos:

Elige tu puerta. Dimensiona tu equipo. Arrastra el uso.

Gasto anual en IA con el despliegue elegido (en negrita), el mismo despliegue con el enrutado de Flowstate y las otras puertas para comparar. La distancia hasta la línea verde es lo que te ahorra el enrutado. La distancia hasta la línea discontinua más barata es lo que te cuesta tu puerta.

Claude for Enterprise, hoy
3,26 M$/año
tu elección, sin enrutado
+ enrutado Flowstate
1,89 M$/año
ahorra 1,38 M$ (42 %)
Puerta más barata: Teams (Premium)
2,35 M$/año
915 mil $ menos que tu puerta
0 $2,63 M$5,25 M$7,88 M$10,50 M$0M250M500M750M1000Mtokens por miembro del equipo / mes
Claude for Enterprise, hoyClaude for Enterprise + FlowstateClaude for Teams (Premium)
375M

Fíjate en lo que pasa al arrastrar. Con poco uso las dos puertas casi no se diferencian, y Enterprise es en realidad la más barata, que es por lo que nada de esto importa para un equipo pequeño. Sube el uso y la línea medida se dispara. El enrutamiento le recorta de un tercio a la mitad, y en el extremo alto incluso pasarse a un puesto de Teams de tarifa plana empieza a ganar. Pero solo puedes hacer cualquiera de los dos movimientos cuando ves la factura con la claridad suficiente para comparar, y la mayoría de los equipos no la tienen.

Qué proyectos se pagaron solos

El enrutamiento arregla lo que pagas por tarea. La pregunta más difícil es qué compraste con ello, y eso no se lee en la factura. El coste es solo la mitad de la que la gente discute. La atribución es la mitad que cuesta más en silencio.

Cuando alguien se gasta 300 $ de Opus este mes, la pregunta no es qué modelo, es qué proyecto. Si no puedes responderla, cada dólar cae en el mismo cajón de OpEx sin distinguir y se lleva a gastos en cuanto se gasta. Finanzas ve un cargo de Anthropic y una cifra, no puede atarlo a una persona ni a un trabajo, y por eso no puede hacer nada con él salvo verlo crecer. Es una segunda nómina sin centros de coste.

Una factura sin contexto es solo una factura, un número que subió. Con contexto se convierte en un mapa. Puedes ver que el equipo que construye el nuevo flujo de facturación quema 40k $ de tiempo de modelo al mes, mientras un experimento que nadie aprobó quema 60k $. Puedes ver qué funciones cuestan más de lo que llegarán a recuperar, y cuáles baratas llevan en silencio la hoja de ruta. Eso no es recortar costes. Es saber dónde está tu palanca, qué trabajo alimentar y cuál dejar sin comida. El gasto atribuido deja de ser la cifra que le da pavor a finanzas y se convierte en la lectura más afilada que tienes de dónde se crea valor de verdad.

Y cambia la contabilidad, no solo cómo se informa de ella. El gasto en IA que se dedica a construir software nuevo se puede capitalizar y amortizar a lo largo de su vida útil, igual que el desarrollo de software tradicional según la IAS 38 o la ASC 350-403. El obstáculo nunca fueron las normas contables. Fue la falta de atribución. No puedes capitalizar lo que no puedes atribuir, y la factura del proveedor no atribuye nada. Flowstate ata cada llamada a una persona, un proyecto, un modelo y una clase de coste, y así el trabajo que construye valor real deja de esconderse en el OpEx.

Y cuanto más de tu trabajo cumpla los requisitos, mayor es el efecto. Si el 70 % de tu esfuerzo de desarrollo es de verdad construir producto nuevo (y en muchos equipos lo es), la atribución traslada la mayor parte de ese gasto en IA de la cuenta de resultados de este trimestre al balance, para amortizarlo durante los años en que el software genere ingresos. Con una factura de IA de siete cifras, eso no es una tarea administrativa. Es la diferencia entre un golpe al margen ahora y un activo que recuperas después. (Si un proyecto concreto cumple los requisitos es un juicio para tu equipo de finanzas y auditoría, no para un post de blog.)

Dónde encajamos

Flowstate es un proxy inteligente: piensa en Zscaler, pero para el tráfico de IA. No juntamos cuentas y no guardamos tus contratos. Tú conservas tus propias claves y tu propio acuerdo con cada proveedor que usa tu equipo. Nos ponemos en la ruta de las peticiones y hacemos tres cosas con cada llamada que pasa: la enrutamos al modelo que la tarea necesita de verdad, la inspeccionamos en busca de lo que nunca debería salir (código fuente, datos personales de clientes camino de donde no deben) y la registramos contra una persona, un proyecto y una clase de coste. Esa es la visibilidad por la que Enterprise cobra un extra, sin el extra y sin entregarle a nadie tus contratos.

Como somos un proxy y no un fondo común de cuentas, dónde te sitúas en los términos de un proveedor sigue siendo decisión tuya, tomada con el cuadro completo delante en lugar de a oscuras. Puedes ver lo que cuesta de verdad cada despliegue, bajar el gasto con el enrutamiento y subir o bajar el grifo por equipo según el riesgo que estés dispuesto a asumir. Las dos fugas de arriba son la misma máquina haciendo dos trabajos: mandar cada petición al modelo correcto y hacer el despliegue que has elegido lo bastante legible para gestionarlo.

Un par de salvedades, sin rodeos. Flowstate hace que un despliegue sea observable y controlable. No reescribe tu contrato. Si necesitas un BAA, residencia de datos o una cláusula contractual de no entrenamiento, esa es la puerta Enterprise, y ahí lo nuestro es el enrutamiento y el libro de cuentas: evitar que la factura medida se te escape. Y todo esto es una historia de uso intensivo: para un equipo pequeño la factura medida nunca se acerca al punto en que nada de esto se amortice, como muestra la calculadora en cuanto bajas el uso.

Durante años, la disyuntiva parecía binaria: dejar que la gente use el modelo que tenga delante y pagar la factura, o cerrarlo todo y vigilar cada prompt a mano.

No debería ser una elección binaria entre pagar la factura y frenar a tu equipo en seco con límites de uso. Enruta la tarea y dejas de pagar precio de Opus por trabajo de Sonnet. Atribuye el gasto y la IA deja de ser un golpe indiferenciado al margen. Solo hace falta un proxy en medio que te dé los controles.4


Footnotes

  1. Ding et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024, reporta hasta un 40 % menos de llamadas al modelo grande sin caída en la calidad de las respuestas. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, reporta reducciones de coste de más de 2× en partes de su benchmark sin comprometer la calidad. Los routers de los proveedores anuncian cifras más altas (40–70 %). Yo he modelado con la cifra revisada por pares. arxiv.org/abs/2404.14618 · arxiv.org/abs/2406.18665 ↩

  2. Anthropic separó las cuotas de puesto de Enterprise del uso de tokens en 2026: según el Centro de ayuda de Claude, “Usage isn’t included in the seat fee…” y “Every token your team uses… is billed at standard API rates on top of your seat cost.” Los límites de sesión por puesto cambian según el nivel, y un puesto Team Premium tiene unas 6,25× el límite por sesión de Pro. Los puestos base publicados cuestan 20 $ (Team Standard y Enterprise) y 100 $ (Team Premium). El precio real de Enterprise se negocia con ventas. support.claude.com/en/articles/9797531 · support.claude.com/en/articles/9266767 · claude.com/pricing ↩

  3. La IAS 38 Intangible Assets (fase de desarrollo) y la ASC 350-40 (software de uso interno) regulan cuándo el coste de desarrollo se puede capitalizar en lugar de llevarse a gastos. La admisibilidad es cuestión de juicio y de auditoría, no de afirmación. Nada de lo que aquí se dice es asesoramiento contable. ↩

  4. Cofundé Flowstate, así que se aplica la obvia declaración de conflicto de intereses. Las cifras de enrutamiento de arriba están modeladas a partir de precios públicos y de la investigación citada, no de la cuenta de un cliente. ↩