Construímos um Dashboard para Domar os Custos dos LLM — E Isso Mudou a Forma Como Praticamos
Há um momento em cada aula de yoga em que um aluno deixa de tentar forçar uma postura e simplesmente repara no que o corpo está a fazer. A anca está tensa. A respiração está superficial. O ombro está a compensar. Esse momento de consciência — sem julgamento, preciso — é onde a mudança começa. Não no forçar. No reparar.
Construímos o AI Model Pricing Dashboard exatamente pelo mesmo motivo. Não porque quiséssemos gastar mais em Large Language Models, mas porque não conseguíamos dizer-lhe — de forma honesta, precisa — quanto já estávamos a gastar. Ninguém na equipa sabia. As faturas chegavam e ninguém conseguia responder à pergunta simples: que modelos estamos realmente a usar e a que custo por fornecedor?
A confusão por baixo da superfície
Se já executou cargas de trabalho de IA em vários fornecedores, conhece a dor. A OpenRouter cobra por token com uma taxa. A OpenAI separa tokens de input e output com preços diferentes. A Anthropic tem a sua própria estrutura. A Kilo AI Gateway acrescenta planos de subscrição com matemática de excedentes. Cada fornecedor conta tokens de forma diferente. Cada fornecedor altera a sua tabela de preços sem nota de lançamento.
É um pouco como tentar praticar yoga lendo cinco livros diferentes em cinco línguas diferentes, nenhum dos quais concorda sobre o que significa "Downward Dog". Dá para desenrascar. Mas vai compensar. E a compensação tem um custo — pago em dinheiro do lado da infraestrutura, pago em alinhamento no tapete.
O que o dashboard faz
O AI Model Pricing Dashboard é uma ferramenta open-source — BSD 3-Clause, friendly para MIT — construída com um backend FastAPI e um frontend Next.js. Agrega preços de 10+ fornecedores de LLM, normaliza tudo para dólares por um milhão de tokens e oferece-lhe uma única tabela filtrável e ordenável que torna a comparação simples.
Mas o verdadeiro valor não está na tabela. O verdadeiro valor está no que a tabela revela:
Matemática de tokens de input versus output. A maioria das equipas pensa em termos de "custo por chamada". Mas a utilização moderna de LLM é dominada por tokens de output — as respostas do modelo. Um modelo que cobra $2 por um milhão de tokens de input, mas $15 por um milhão de tokens de output, tem um perfil de custos completamente diferente de um que cobra $5 e $6, respetivamente. O dashboard torna isto visível de imediato.
Contexto do contexto. Um modelo com uma janela de contexto de 128K pode parecer mais caro por token do que um com uma janela de 4K. Mas se estiver atualmente a encadear várias chamadas a um modelo mais barato para lidar com prompts longos, o modelo mais caro com uma grande janela de contexto é, na verdade, mais barato — e produz melhores resultados.
Acompanhamento de tendências. Os preços mudam. O dashboard armazena 30 days de histórico de preços. Isso significa que vê as alterações de preço dos fornecedores antes de chegarem à sua próxima fatura.
Projeção do plano Kilo. Se for utilizador do Kilo AI Gateway, o dashboard mapeia a utilização real contra cada escalão e diz-lhe qual o plano que minimiza o seu custo total, incluindo excedentes.
A arquitetura por baixo
O sistema funciona com Postgres e Redis, com manifests de Kubernetes para implementação em produção. O backend FastAPI trata da agregação de preços com uma cache Redis de 900 segundos — suficientemente rápida para utilização em tempo real no dashboard, suficientemente suave para as APIs dos fornecedores. Os CronJobs atualizam os preços a cada 15 minutes e enviam relatórios diários por email às 9 AM UTC.
Para desenvolvimento local, toda a stack arranca com docker-compose.yaml — Postgres, Redis, a API e o frontend Next.js — em menos de dois minutos.
Escolhemos Kubernetes não porque o dashboard precise de escala massiva, mas porque o padrão de implementação deve ser aborrecido. Traefik para ingress, cert-manager para TLS, autoescalamento horizontal de pods para a API e as réplicas web. Aborrecido é fiável. Fiável é o que quer quando esta ferramenta está a informar decisões orçamentais.
Onde o yoga encontra o dashboard
Aqui está a parte que nenhum blog de arquitetura lhe dirá: a otimização de custos e o yoga partilham o mesmo primeiro passo.
No yoga, dizemos a consciência precede a mudança. Não pode corrigir uma anca desalinhada se não souber que está desalinhada. Não pode suavizar uma mandíbula cronicamente tensa se nunca tiver reparado que estava rígida. O reparar é a prática. O reparar é onde a agência começa.
O dashboard existe porque reparámos. Pela primeira vez, tivemos uma imagem precisa e honesta do que as nossas cargas de trabalho de IA realmente custavam — não uma estimativa, não uma sensação vaga de que "parece caro", mas um número. E, quando se tem um número, pode-se tomar uma decisão. Mudamos de fornecedor para esta carga de trabalho? Usamos um modelo mais barato para tarefas não críticas? Fazemos mais cache de forma agressiva? Escolhemos o modelo com a janela de contexto maior e eliminamos o encadeamento de chamadas?
Nenhuma dessas decisões era visível antes. Não porque os dados não existissem, mas porque estavam espalhados por cinco dashboards de fornecedores, três páginas de faturação e uma folha de cálculo que ninguém atualizava.
Construímos o scraper. Construímos o normalizador. Construímos o dashboard. E, na primeira semana em que o usamos, encontrámos uma ineficiência de $40/month que se arrastava há quatro months. São $160 que gastámos porque não estávamos a olhar. O dashboard custou menos do que uma noite a configurar.
O que estamos a aprender com os dados
Desde que implementámos o dashboard, três coisas mudaram na forma como operamos:
Dimensionamento adequado por tarefa. Agora atribuímos modelos específicos a tarefas específicas com base no custo real por tarefa, e não na preferência pela marca. Tarefas repetitivas e de baixa complexidade vão para modelos mais baratos e rápidos. Tarefas de raciocínio complexo vão para onde a qualidade justifica o preço. Esta não é uma ideia nova — é o mesmo princípio de escolher uma prática restaurativa ou um power flow com base no que o seu corpo realmente precisa nesse dia.
Caching como pranayama. No yoga, pranayama (controlo da respiração) é a prática de fazer com que cada respiração conte — menos volume, mais intenção, melhor troca de oxigénio. Fazer cache das respostas dos LLM é o mesmo conceito. Se o mesmo prompt produz o mesmo resultado, guarda-o. Não paga pela mesma computação duas vezes. A cache Redis do dashboard com um TTL de 900 seconds reduziu o nosso gasto com tokens repetidos em cerca de 30%. Respirar menos, obter mais.
Consciência de tendências. Acompanhar tendências de preços ao longo de 30 days significa que vemos as descidas de preços dos fornecedores antes de vermos publicações no blog sobre isso. Quando um fornecedor baixa a sua taxa em 20%, ficamos a saber no espaço de uma hora. Quando um fornecedor aumenta os preços, podemos reavaliar antes do próximo ciclo de faturação. Consciência. Agência. Decisão.
Open source, porque acumular ferramentas é má yoga
O projeto tem licença MIT no GitHub: github.com/andreab67/ai-models-pricing. Os manifests de Kubernetes estão incluídos. A documentação da API está em FUNCTIONAL.md. O SBOM — cada dependência, a sua licença, as suas notas de segurança — está em SBOM.md.
Tornámos isto open-source porque o problema não é só nosso. Todas as equipas que executam cargas de trabalho de IA multi-fornecedor têm este problema. E acumular ferramentas úteis é, para usar uma analogia de yoga, como recusar ensinar a um aluno uma postura que o poderia ajudar. A prática não é diminuída por ser partilhada. É aprofundada.
Um passo para esta semana
Se a sua equipa executa cargas de trabalho de LLM e não consegue responder de imediato a "o que estamos a gastar por fornecedor por tarefa" — está a compensar. Não mal. Apenas de forma dispendiosa.
Configure o dashboard localmente. Demora dois minutos com Docker. Execute-o. Veja os números. Deixe que os números lhe digam algo que não tinha reparado.
Depois decida.
Essa é a mesma prática que fazemos no tapete: chegar, reparar, escolher. As ferramentas mudam. O princípio não.
O AI Model Pricing Dashboard é open source em github.com/andreab67/ai-models-pricing. A instância de produção corre no nosso cluster Kubernetes. Se quiser ajuda para o implementar ou integrá-lo no seu próprio pipeline de alertas de custos, entre em contacto.
