IT27 de mayo de 2026

Construimos un panel para domar los costes de los LLM — Y cambió nuestra forma de practicar

Por Andrea Borghi
Construimos un panel para domar los costes de los LLM — Y cambió nuestra forma de practicar

Construimos un panel para domar los costes de los LLM — Y cambió nuestra forma de practicar

Hay un momento en cada clase de yoga en el que una alumna deja de intentar forzar una postura y simplemente advierte lo que está haciendo el cuerpo. La cadera está rígida. La respiración es superficial. El hombro compensa. Ese momento de conciencia —sin juicio, preciso— es donde empieza el cambio. No en el forzar. En el advertir.

Construimos el AI Model Pricing Dashboard exactamente por la misma razón. No porque quisiéramos gastar más en Large Language Models, sino porque no podíamos decirte —con honestidad, con precisión— cuánto estábamos gastando ya. Nadie del equipo lo sabía. Llegaban las facturas y nadie podía responder a la simple pregunta: qué modelos estamos usando realmente, y a qué coste por proveedor?

El lío bajo el capó

Si has ejecutado cargas de trabajo de IA en varios proveedores, conoces el problema. OpenRouter cobra por token con una tarifa. OpenAI separa los tokens de entrada y salida con precios distintos. Anthropic tiene su propia estructura. Kilo AI Gateway añade planes de suscripción con cálculos de excedentes. Cada proveedor cuenta los tokens de forma diferente. Cada proveedor cambia su hoja de tarifas sin una nota de versión.

Es un poco como intentar practicar yoga leyendo cinco libros distintos en cinco idiomas distintos, y que ninguno se ponga de acuerdo sobre lo que significa "Downward Dog". Puedes salir del paso. Pero compensarás. Y la compensación tiene un coste: se paga en dinero en la infraestructura, se paga en alineación sobre la esterilla.

Qué hace el panel

El AI Model Pricing Dashboard es una herramienta de código abierto — BSD 3-Clause, amigable con MIT — construida con un backend FastAPI y un frontend Next.js. Agrega precios de más de 10 proveedores de LLM, normaliza todo a dólares por millón de tokens y te ofrece una única tabla filtrable y ordenable que hace que comparar sea sencillo.

Pero el valor real no está en la tabla. El valor real es lo que la tabla revela:

  • Cálculo de tokens de entrada frente a salida. La mayoría de los equipos piensan en términos de "coste por llamada". Pero el uso moderno de LLM está dominado por los tokens de salida — las respuestas del modelo. Un modelo que cobra $2 por millón de tokens de entrada pero $15 por millón de tokens de salida tiene un perfil de coste completamente distinto al de uno que cobra $5 y $6 respectivamente. El panel lo hace visible al instante.

  • Contexto del tamaño de la ventana de contexto. Un modelo con una ventana de contexto de 128K puede parecer más caro por token que uno con una ventana de 4K. Pero si ahora mismo estás encadenando varias llamadas a un modelo más barato para gestionar prompts largos, el modelo caro con la gran ventana de contexto en realidad sale más barato — y produce mejores resultados.

  • Seguimiento de tendencias. Los precios cambian. El panel almacena el historial de precios de 30 días. Eso significa que ves los movimientos de precios del proveedor antes de que lleguen a tu próxima factura.

  • Proyección del plan Kilo. Si eres usuario de Kilo AI Gateway, el panel compara el uso real con cada nivel y te indica qué plan minimiza tu coste total, incluidos los excedentes.

La arquitectura que hay debajo

El sistema funciona con Postgres y Redis, con manifiestos de Kubernetes para el despliegue en producción. El backend FastAPI gestiona la agregación de precios con una caché de Redis de 900 segundos: lo bastante rápida para un uso en tiempo real del panel, y lo bastante suave con las API de los proveedores. Los CronJobs actualizan los precios cada 15 minutos y envían informes diarios por correo electrónico a las 9 AM UTC.

Para el desarrollo local, toda la pila arranca con docker-compose.yaml — Postgres, Redis, la API y el frontend de Next.js — en menos de dos minutos.

Elegimos Kubernetes no porque el panel necesite una escala masiva, sino porque el patrón de despliegue debería ser aburrido. Traefik para la entrada, cert-manager para TLS, escalado horizontal automático de pods para las réplicas de la API y la web. Lo aburrido es fiable. Lo fiable es lo que quieres cuando esta herramienta está informando decisiones de presupuesto.

Donde el yoga se encuentra con el panel

Aquí está la parte que ningún blog de arquitectura te contará: la optimización de costes y el yoga comparten el mismo primer paso.

En yoga, decimos la conciencia precede al cambio. No puedes corregir una cadera desalineada si no sabes que lo está. No puedes suavizar una mandíbula crónicamente tensa si nunca has advertido que estaba rígida. El advertir es la práctica. El advertir es donde empieza la agencia.

El panel existe porque nos dimos cuenta. Por primera vez, teníamos una imagen precisa y honesta de lo que realmente costaban nuestras cargas de trabajo de IA: no una estimación, no una vaga sensación de que "parece caro", sino una cifra. Y una vez que tienes una cifra, puedes tomar una decisión. ¿Cambiamos de proveedor para esta carga? ¿Usamos un modelo más barato para tareas no críticas? ¿Cacheamos de forma más agresiva? ¿Elegimos el modelo con la ventana de contexto más grande y eliminamos el encadenamiento de llamadas?

Ninguna de esas decisiones era visible antes. No porque los datos no existieran, sino porque estaban dispersos entre cinco paneles de proveedores, tres páginas de facturación y una hoja de cálculo que nadie actualizaba.

Construimos el scraper. Construimos el normalizador. Construimos el panel. Y la primera semana que lo usamos, encontramos una ineficiencia de $40/mes que llevaba cuatro meses funcionando. Son $160 que gastamos porque no estábamos mirando. El panel costó menos que una tarde en configurarse.

Lo que estamos aprendiendo de los datos

Desde que desplegamos el panel, han cambiado tres cosas en cómo operamos:

Ajustar el tamaño según la tarea. Ahora asignamos modelos concretos a tareas concretas basándonos en el coste real por tarea, no en la preferencia de marca. Las tareas de alta repetición y baja complejidad van a modelos más baratos y rápidos. Las tareas de razonamiento complejo van donde la calidad justifica el precio. No es una idea nueva: es el mismo principio que elegir una práctica restaurativa o un flow de fuerza según lo que tu cuerpo necesita realmente ese día.

Caching como pranayama. En yoga, pranayama (control de la respiración) es la práctica de hacer que cada respiración cuente: menos volumen, más intención, mejor intercambio de oxígeno. Cachear respuestas de LLM es el mismo concepto. Si el mismo prompt produce la misma salida, lo guardas. No pagas dos veces por el mismo cálculo. La caché de Redis del panel, con un TTL de 900 segundos, ha reducido nuestro gasto en tokens repetidos en aproximadamente un 30%. Respirar menos, obtener más.

Conciencia de tendencias. Hacer seguimiento de las tendencias de precios durante 30 días significa que vemos las bajadas de precios de los proveedores antes de ver publicaciones sobre ellas. Cuando un proveedor baja su tarifa un 20%, lo sabemos en una hora. Cuando un proveedor sube las tarifas, podemos reevaluar antes del siguiente ciclo de facturación. Conciencia. Agencia. Decisión.

Código abierto, porque acaparar herramientas es un mal yoga

El proyecto tiene licencia MIT en GitHub: github.com/andreab67/ai-models-pricing. Los manifiestos de Kubernetes están incluidos. La documentación de la API está en FUNCTIONAL.md. El SBOM — cada dependencia, su licencia, sus notas de seguridad — está en SBOM.md.

Lo hemos publicado como código abierto porque el problema no es solo nuestro. Todos los equipos que ejecutan cargas de trabajo de IA multi-proveedor tienen este problema. Y acaparar herramientas útiles es, usando una analogía de yoga, como negarse a enseñar a una alumna una postura que le ayudaría. La práctica no se reduce por compartirla. Se profundiza.

Un movimiento para esta semana

Si tu equipo ejecuta cargas de trabajo de LLM y no puedes responder de inmediato "qué estamos gastando por proveedor por tarea" — estás compensando. No mal. Solo de forma costosa.

Configura el panel en local. Tarda dos minutos con Docker. Ejecútalo. Mira los números. Deja que los números te digan algo que no habías advertido.

Entonces decide.

Esa es la misma práctica que hacemos sobre la esterilla: llegar, advertir, elegir. Las herramientas cambian. El principio no.


El AI Model Pricing Dashboard es de código abierto en github.com/andreab67/ai-models-pricing. La instancia de producción funciona en nuestro clúster de Kubernetes. Si quieres ayuda para desplegarlo o integrarlo con tu propio pipeline de alertas de costes, escríbenos.