IT27 de mayo de 2026

Construimos un panel para domar los costes de los LLM — Y cambió cómo practicamos

Por Andrea Borghi
Construimos un panel para domar los costes de los LLM — Y cambió cómo practicamos

Construimos un panel para domar los costes de los LLM — Y cambió cómo practicamos

Hay un momento en cada clase de yoga en el que un alumno deja de intentar forzar una postura y simplemente se da cuenta de lo que está haciendo el cuerpo. La cadera está rígida. La respiración es superficial. El hombro está compensando. Ese momento de conciencia — sin juicio, preciso — es donde empieza el cambio. No en el forzar. En el darse cuenta.

Construimos el AI Model Pricing Dashboard exactamente por la misma razón. No porque quisiéramos gastar más en Large Language Models, sino porque no podíamos decirte — con honestidad y precisión — cuánto estábamos gastando ya. Nadie del equipo lo sabía. Llegaban las facturas y nadie podía responder a la pregunta simple: qué modelos estamos usando realmente, y a qué coste por proveedor?

El caos bajo el capó

Si has ejecutado cargas de trabajo de IA con varios proveedores, conoces el problema. OpenRouter cobra por token con una tarifa. OpenAI separa los tokens de entrada y de salida con precios diferentes. Anthropic tiene su propia estructura. Kilo AI Gateway añade planes de suscripción con cálculos por exceso. Cada proveedor cuenta los tokens de forma distinta. Cada proveedor cambia su hoja de precios sin una nota de versión.

Es un poco como intentar practicar yoga leyendo cinco libros diferentes en cinco idiomas distintos, ninguno de los cuales coincide en lo que significa "Downward Dog". Puedes ir tirando. Pero acabarás compensando. Y la compensación tiene un coste: se paga en dinero en la parte de la infraestructura, y en alineación sobre la esterilla.

Qué hace el panel

El AI Model Pricing Dashboard es una herramienta de código abierto — BSD 3-Clause, compatible con MIT — creada con un backend de FastAPI y un frontend de Next.js. Agrega los precios de más de 10 proveedores de LLM, normaliza todo a dólares por millón de tokens y te ofrece una única tabla filtrable y ordenable que hace que comparar sea sencillo.

Pero el valor real no es la tabla. El valor real es lo que la tabla revela:

  • Métrica de tokens de entrada frente a salida. La mayoría de los equipos piensa en términos de "coste por llamada". Pero el uso moderno de los LLM está dominado por los tokens de salida — las respuestas del modelo. Un modelo que cobra 2 $ por millón de tokens de entrada pero 15 $ por millón de tokens de salida tiene un perfil de costes completamente distinto al de uno que cobra 5 $ y 6 $ respectivamente. El panel hace esto visible al instante.

  • Contexto del tamaño de ventana de contexto. Un modelo con una ventana de contexto de 128K puede parecer más caro por token que uno con una ventana de 4K. Pero si actualmente encadenas varias llamadas a un modelo más barato para gestionar prompts largos, el modelo caro con la gran ventana de contexto en realidad sale más barato — y produce mejores resultados.

  • Seguimiento de tendencias. Los precios cambian. El panel almacena 30 días de historial de precios. Eso significa que ves los movimientos de precios del proveedor antes de que lleguen a tu próxima factura.

  • Proyección del plan de Kilo. Si eres usuario de Kilo AI Gateway, el panel compara el uso real con cada nivel y te dice qué plan minimiza tu coste total, incluidos los excesos.

La arquitectura debajo

El sistema funciona sobre Postgres y Redis, con manifiestos de Kubernetes para el despliegue en producción. El backend de FastAPI gestiona la agregación de precios con una caché Redis de 900 segundos: lo bastante rápido para usar el panel en tiempo real, y lo bastante amable con las APIs de los proveedores. Los CronJobs actualizan los precios cada 15 minutos y envían informes diarios por correo electrónico a las 9 AM UTC.

Para el desarrollo local, toda la pila se levanta con docker-compose.yml — Postgres, Redis, la API y el frontend de Next.js — en menos de dos minutos.

Elegimos Kubernetes no porque el panel necesite una escala masiva, sino porque el patrón de despliegue debería ser aburrido. Traefik para el ingress, cert-manager para TLS, autoescalado horizontal de pods para las réplicas de la API y la web. Lo aburrido es fiable. Lo fiable es lo que quieres cuando esta herramienta está informando decisiones presupuestarias.

Donde el yoga se encuentra con el panel

Aquí está la parte que ningún blog de arquitectura te contará: la optimización de costes y el yoga comparten el mismo primer paso.

En yoga decimos la conciencia precede al cambio. No puedes corregir una cadera desalineada si no sabes que está desalineada. No puedes relajar una mandíbula crónicamente tensa si nunca te has dado cuenta de que lo estaba. Darse cuenta es la práctica. Darse cuenta es donde empieza la capacidad de actuar.

El panel existe porque nos dimos cuenta. Por primera vez, teníamos una imagen precisa y honesta de lo que realmente costaban nuestras cargas de trabajo de IA: no una estimación, no una vaga sensación de que "parece caro", sino una cifra. Y una vez que tienes una cifra, puedes tomar una decisión. ¿Cambiamos de proveedor para esta carga de trabajo? ¿Usamos un modelo más barato para tareas no críticas? ¿Aumentamos la caché de forma más agresiva? ¿Elegimos el modelo con la ventana de contexto más grande y eliminamos la encadenación de llamadas?

Ninguna de esas decisiones era visible antes. No porque los datos no existieran, sino porque estaban dispersos entre cinco paneles de proveedores, tres páginas de facturación y una hoja de cálculo que nadie actualizaba.

Construimos el scraper. Construimos el normalizador. Construimos el panel. Y la primera semana que lo usamos, encontramos una ineficiencia de 40 $/mes que llevaba cuatro meses funcionando. Eso son 160 $ que gastamos porque no estábamos mirando. El panel costó menos que una tarde de configuración.

Qué estamos aprendiendo de los datos

Desde que desplegamos el panel, tres cosas han cambiado en cómo trabajamos:

Dimensionamiento adecuado según la tarea. Ahora asignamos modelos específicos a tareas específicas basándonos en el coste real por tarea, no en la preferencia por la marca. Las tareas de alta repetición y baja complejidad van a modelos más baratos y rápidos. Las tareas de razonamiento complejo van donde la calidad justifica el precio. No es una idea nueva: es el mismo principio que elegir una práctica restaurativa frente a una secuencia de power flow en función de lo que tu cuerpo necesita realmente ese día.

La caché como pranayama. En yoga, pranayama (control de la respiración) es la práctica de hacer que cada respiración cuente: menos volumen, más intención, mejor intercambio de oxígeno. Guardar en caché las respuestas de los LLM es el mismo concepto. Si el mismo prompt produce la misma salida, lo almacenas. No pagas dos veces por el mismo cálculo. La caché Redis del panel, con un TTL de 900 segundos, ha reducido nuestro gasto en tokens repetidos en aproximadamente un 30%. Respirar menos, obtener más.

Conciencia de tendencias. Seguir las tendencias de precios durante 30 días significa que vemos las bajadas de precios de los proveedores antes de ver entradas de blog sobre ellas. Cuando un proveedor baja su tarifa un 20%, lo sabemos en menos de una hora. Cuando un proveedor sube las tarifas, podemos reevaluarlo antes del siguiente ciclo de facturación. Conciencia. Capacidad de actuar. Decisión.

Código abierto, porque acaparar herramientas es mal yoga

El proyecto tiene licencia BSD 3-Clause en GitHub: github.com/andreab67/ai-models-pricing. Los manifiestos de Kubernetes están incluidos. La documentación de la API está en FUNCTIONAL.md. El SBOM — cada dependencia, su licencia, sus notas de seguridad — está en SBOM.md.

Hemos publicado esto como código abierto porque el problema no es solo nuestro. Todos los equipos que ejecutan cargas de trabajo de IA con varios proveedores tienen este problema. Y acaparar herramientas útiles es, usando una analogía del yoga, como negarse a enseñar a un alumno una postura que le ayudaría. La práctica no se ve reducida por compartir. Se profundiza.

Un movimiento para esta semana

Si tu equipo ejecuta cargas de trabajo de LLM y no puedes responder de inmediato "qué estamos gastando por proveedor y por tarea" — estás compensando. No mal. Solo caro.

Configura el panel en local. Tarda dos minutos con Docker. Ejecútalo. Mira las cifras. Deja que las cifras te digan algo que no habías notado.

Después decide.

Esa es la misma práctica que hacemos sobre la esterilla: llegar, darse cuenta, elegir. Las herramientas cambian. El principio no.


El AI Model Pricing Dashboard es de código abierto en github.com/andreab67/ai-models-pricing. La instancia de producción se ejecuta en nuestro clúster de Kubernetes. Si quieres ayuda para desplegarlo o integrarlo con tu propio pipeline de alertas de costes, contacta.