Hay un principio silencioso en yoga que se aplica de forma sorprendentemente buena a la tecnología: usar exactamente el esfuerzo que requiere el momento — ni más ni menos. La mayoría de los equipos que ejecutan IA hoy hacen justo lo contrario. Están dedicando el máximo esfuerzo a cada tarea, la necesite o no, y pagando el privilegio token a token.
Hablemos de por qué tus costes de IA no dejan de subir — y de cómo devolverlos a algo intencionado.
Los modelos frontera están diseñados para consumir tokens
Los modelos frontera de Anthropic y OpenAI son realmente extraordinarios, y gran parte del por qué es que la generación más reciente simplemente hace más trabajo por solicitud. Razonan paso a paso. "Piensan" antes de responder. Ejecutan bucles agentivos más largos y de varios pasos. Ofrecen respuestas exhaustivas, prudentes y ricas en contexto.
Esto supone una auténtica mejora en la experiencia de usuario. Las respuestas son mejores, más cuidadosas y más capaces que las de los modelos escuetos de hace un par de años. Pero también trae consigo un efecto secundario estructural que merece decirse claramente:
Estos modelos se tarifican por token, y están diseñados para usar más tokens.
Más razonamiento, más salida, más ida y vuelta: todo ello mejora la experiencia y aumenta el consumo. Los incentivos de quienes te venden tokens y los tuyos, como comprador, no apuntan en la misma dirección. Terminas pagando una deliberación profunda en tareas que solo necesitaban una respuesta en una línea.
Lo que esto cuesta realmente a una empresa
En un único chat, el coste es invisible: una fracción de céntimo. El problema es la escala.
- Un flujo de trabajo de atención al cliente que gestiona 50,000 mensajes al día.
- Un pipeline de contenido que genera cientos de borradores.
- Un agente interno que entra en bucle cinco o seis veces por tarea para "razonarlo".
Multiplica el uso de tokens por llamada por la sobrecarga de razonamiento, luego por el volumen, y luego por 30 days. Un flujo de trabajo que parecía ridículamente barato en la demo se convierte en un gasto operativo serio y recurrente — y que crece cada vez que añades una funcionalidad o un cliente. Peor aún, es impredecible: un modelo que decide pensar más este mes eleva silenciosamente tu factura sin que nadie entregue ni una sola línea de código nuevo.
Para una empresa pequeña o mediana, esa imprevisibilidad es el verdadero impuesto.
La alternativa local: Ollama
Aquí está el cambio de mentalidad. No todas las tareas necesitan un modelo frontera. De hecho, la mayoría no.
Ollama te permite ejecutar modelos de código abierto capaces — Llama, Mistral, Qwen y muchos otros — directamente en tu propio hardware o en un servidor modesto. Una vez en funcionamiento, el coste marginal de una solicitud cae prácticamente a cero. Ya has pagado la computación; no hay un contador por token girando.
La contrapartida es que un modelo local de 7B–30B no es tan brillantemente versátil como un modelo frontera. Pero para trabajos bien definidos y repetibles — clasificación, extracción, resumen, enrutamiento, redacción a partir de una plantilla — un modelo local más pequeño es más que suficiente. El arte está en saber qué tareas mantener en local y cuáles escalar.
Las habilidades personalizadas de AnythingLLM: la palanca real
Aquí es donde vive la mayor parte del ahorro.
AnythingLLM es una aplicación de código abierto que envuelve modelos locales (a través de Ollama) en un espacio de trabajo limpio con soporte para documentos/RAG y, crucialmente, un sistema de habilidades personalizadas. En lugar de pedir a un modelo que razone desde cero la misma tarea una y otra vez, codificas la parte repetible del trabajo como una habilidad determinista: código real que se ejecuta de forma predecible, llama a tus APIs, da formato a tu salida y solo devuelve al modelo las decisiones realmente ambiguas.
El resultado es un híbrido:
- El código determinista hace el trabajo pesado y repetible — gratis, siempre, de manera idéntica.
- El modelo solo se invoca para la pequeña parte de la tarea que de verdad requiere criterio.
Obtienes el mismo resultado final, con una fracción del consumo de tokens — porque has dejado de pagar a un modelo de lenguaje para que vuelva a derivar un proceso que ya conoces.
Dónde encajan los servidores MCP
Un modelo local pequeño solo es tan útil como aquello a lo que puede acceder. Ese es el papel de los servidores MCP (Model Context Protocol).
MCP es un estándar abierto para conectar modelos de IA con herramientas, datos y sistemas en vivo — bases de datos, almacenes de archivos, APIs internas, sistemas de tickets, tu CRM. AnythingLLM admite servidores MCP, lo que significa que tu stack local no es un chatbot cerrado; es un agente que puede leer datos reales y realizar acciones reales a través de una interfaz limpia y estandarizada.
Esto es lo que hace viable el enfoque local para trabajos serios. Los proveedores frontera quieren que hagas todo dentro de su ventana de contexto medida por tokens. MCP te permite mantener los datos, las herramientas y la lógica determinista de tu lado — y gastar tokens solo en el pensamiento real.
Consejos prácticos: reescribir una habilidad estándar como una habilidad personalizada optimizada
Así es como puedes tomar una tarea que ahora lanzas a un modelo frontera y reconstruirla para que funcione por una fracción del coste.
Perfila primero tu gasto de tokens. Identifica los 3–5 flujos de trabajo que se ejecutan con más frecuencia. Ahí es donde el ahorro se multiplica. No optimices lo que ejecutas dos veces por semana.
Separa lo determinista de lo ambiguo. Revisa qué hace realmente el modelo en cada llamada. Las partes que son iguales siempre — obtener datos, aplicar un formato, validar campos, enrutar — no necesitan en absoluto un modelo de lenguaje.
Mueve las partes deterministas al código. En una habilidad personalizada de AnythingLLM, esa lógica se convierte en una función controladora. Se ejecuta idénticamente cada vez, sin coste de tokens.
Reduce el prompt a la decisión. Dale al modelo solo la pregunta realmente ambigua, con el contexto justo para responderla. Nada de reiterar todo el proceso en cada llamada. Menor entrada, menor salida, menor factura.
Extrae los datos en vivo mediante MCP, no mediante el prompt. No pegues un documento de 4,000 tokens en el contexto cuando una herramienta MCP puede obtener exactamente el campo que necesitas bajo demanda.
Enruta por dificultad. Ejecuta la versión cotidiana en un modelo local de Ollama. Reserva el modelo frontera para el 5% realmente difícil — y deja que tu habilidad decida cuándo escalar.
Mide antes y después. Registra los tokens por tarea antes y después. Los equipos que hacen esto con regularidad suelen encontrar reducciones del 80–95% en sus flujos de trabajo de mayor volumen.
La conclusión intencionada
La IA frontera merece la pena pagarla — cuando la tarea realmente lo requiere. El error es usarla como valor predeterminado para todo y financiar en silencio un contador por token que está diseñado para seguir subiendo.
Ejecuta el trabajo rutinario en local. Codifica lo repetible como habilidades personalizadas. Conéctalo al mundo real con MCP. Reserva los modelos frontera para los momentos que de verdad los necesitan.
Eso no es recortar por la vía fácil. Es simplemente usar el esfuerzo adecuado para el momento — que, casualmente, es una buena práctica tanto en la esterilla como en la nube.
