IT2026年5月27日

我们构建了一个仪表盘来驯服 LLM 成本——它也改变了我们的练习方式

作者:Andrea Borghi
我们构建了一个仪表盘来驯服 LLM 成本——它也改变了我们的练习方式

我们构建了一个仪表盘来驯服 LLM 成本——它也改变了我们的练习方式

在每一堂瑜伽课中,都会有那么一刻:学生不再试图强行完成一个体式,而是 simply 注意到 身体正在做什么。髋部很紧。呼吸很浅。肩膀在代偿。那一刻的觉察——不评判、精准——正是改变开始的地方。不是在强迫中,而是在觉察中。

我们构建了 AI Model Pricing Dashboard,原因完全相同。不是因为我们想在 Large Language Models 上花更多钱,而是因为我们无法诚实、准确地告诉你——我们已经花了多少。团队里没有人知道。账单来了,没有人能回答这个简单的问题:我们实际上在使用哪些模型,以及每家提供商的成本是多少?

引擎盖下的混乱

如果你曾在多个提供商之间运行 AI 工作负载,你就知道这种痛苦。OpenRouter 按 token 收费,采用一种费率。OpenAI 将输入和输出 token 分开,并采用不同价格。Anthropic 有自己的结构。Kilo AI Gateway 在订阅方案之上再叠加超额费用计算。每家提供商计算 token 的方式都不同。每家提供商都会在没有发布说明的情况下更改自己的定价表。

这有点像试图通过阅读五本不同语言的书来练习瑜伽,而这五本书都不同意 "Downward Dog" 的含义。你可以勉强应付过去。但你会进行代偿。而代偿是有代价的——在基础设施一侧以金钱支付,在垫子上以对齐支付。

这个仪表盘的作用

AI Model Pricing Dashboard 是一个开源工具——BSD 3-Clause,兼容 MIT——采用 FastAPI 后端和 Next.js 前端构建。它汇总 10+ 个 LLM 提供商的定价,将一切标准化为每百万 token 的美元成本,并提供一个单一、可筛选、可排序的表格,让比较变得轻而易举。

但真正的价值不在于表格。真正的价值在于表格所揭示的内容:

  • 输入与输出 token 的计算。 大多数团队以“每次调用成本”来思考。但现代 LLM 使用中,输出 token——模型的回复——占主导地位。一个模型对每百万输入 token 收费 $2、对每百万输出 token 收费 $15,与一个分别收取 $5 和 $6 的模型,其成本结构完全不同。仪表盘会立即让这一点变得可见。

  • 上下文窗口的上下文。 一个具有 128K 上下文窗口的模型,按 token 计算看起来可能比一个 4K 窗口的模型更贵。但如果你当前为了处理长提示而对更便宜的模型进行多次串联调用,那么带有大上下文窗口的昂贵模型实际上更便宜——而且效果更好。

  • 趋势追踪。 定价会变化。仪表盘保存 30 天的价格历史。这意味着你能在供应商价格变动影响下一张账单之前看到它们。

  • Kilo 方案预测。 如果你是 Kilo AI Gateway 用户,仪表盘会将实际使用量映射到每个层级,并告诉你哪种方案能让你的总成本最小,包括超额费用在内。

底层架构

该系统运行在 Postgres 和 Redis 上,并使用 Kubernetes manifests 进行生产部署。FastAPI 后端通过 900 秒的 Redis 缓存处理定价聚合——足够快,适合实时仪表盘使用,也足够温和,不会给提供商 API 带来压力。CronJob 每 15 分钟刷新一次价格,并在 UTC 上午 9 点发送每日邮件报告。

对于本地开发,整个栈通过 docker-compose.yaml 启动——Postgres、Redis、API 和 Next.js 前端——不到两分钟即可完成。

我们选择 Kubernetes 不是因为仪表盘需要大规模扩展,而是因为部署模式应该是无聊的。Traefik 负责入口,cert-manager 负责 TLS,API 和 Web 副本使用水平 Pod 自动扩缩容。无聊就是可靠。而当这个工具在影响预算决策时,可靠正是你想要的。

瑜伽与仪表盘相遇的地方

下面这部分,任何架构博客都不会告诉你:成本优化和瑜伽共享同样的第一步。

在瑜伽中,我们说 觉察先于改变。如果你不知道髋部错位,就无法纠正它。如果你从未注意到下颌长期紧咬,就无法让它放松。注意到本身就是练习。注意到本身就是主体性开始的地方。

这个仪表盘之所以存在,是因为我们注意到了。第一次,我们对自己的 AI 工作负载实际成本有了精准、诚实的认识——不是估算,不是模糊地觉得“好像很贵”,而是一个数字。而一旦你有了数字,你就可以做决定。我们要为这项工作负载切换提供商吗?我们要把非关键任务交给更便宜的模型吗?我们要更积极地使用缓存吗?我们要选择上下文窗口更大的模型并取消多次调用串联吗?

在此之前,这些决定都不可见。不是因为数据不存在,而是因为它们分散在五个提供商仪表盘、三个账单页面,以及一个没人更新的电子表格里。

我们构建了抓取器。我们构建了标准化器。我们构建了仪表盘。而我们使用它的第一周,就发现了一个每月 $40 的低效问题,它已经持续了四个月。也就是说,我们因为没有在看,多花了 $160。这个仪表盘的搭建成本还不到一个晚上的时间。

我们从数据中学到了什么

自从部署了这个仪表盘,我们的运营方式有三点变化:

按任务进行适配。 我们现在根据真实的每任务成本,而不是品牌偏好,为特定任务分配特定模型。高重复、低复杂度的任务交给更便宜、更快的模型。复杂推理任务则交给质量足以证明其价格合理的地方。这并不是一个新想法——它与根据当天身体真正需要什么来选择修复性练习还是力量流是一致的。

把缓存当作 pranayama。 在瑜伽中,pranayama(呼吸控制)是一种让每一次呼吸都更有意义的练习——更少的容量、更多的意图、更好的氧气交换。缓存 LLM 响应也是同样的概念。如果相同的提示会产生相同的输出,你就把它存起来。你不会为同样的计算支付两次费用。仪表盘中带有 900 秒 TTL 的 Redis 缓存让我们重复 token 的支出大约减少了 30%。少呼吸,得到更多。

趋势觉察。 跟踪 30 天的定价趋势意味着我们能在看到相关博客文章之前就发现提供商降价。当某家提供商把费率降低 20% 时,我们会在一小时内知道。当某家提供商提高费率时,我们可以在下一个计费周期之前重新评估。觉察。主体性。决定。

开源,因为囤积工具不是好的瑜伽

该项目在 GitHub 上采用 MIT 许可: github.com/andreab67/ai-models-pricing。其中包含 Kubernetes manifests。API 文档位于 FUNCTIONAL.md。SBOM——每个依赖项、其许可证、其安全说明——位于 SBOM.md

我们将它开源,因为这个问题不只是我们的。任何运行多提供商 AI 工作负载的团队都会遇到这个问题。而囤积有用的工具,用瑜伽的类比来说,就像拒绝教学生一个原本能帮助他们的体式。分享不会削弱练习,反而会加深它。

本周可采取的一步

如果你的团队运行 LLM 工作负载,而你无法立刻回答“我们按每家提供商、每项任务分别花了多少”——那你就是在代偿。不是很糟,而是很贵。

在本地部署这个仪表盘。用 Docker 只需两分钟。运行它。看看数字。让数字告诉你一些你之前没有注意到的东西。

然后做决定。

这就是我们在垫子上做的同样练习:到来,觉察,选择。工具会变,原则不会变。


AI Model Pricing Dashboard 是一个开源项目,地址为 github.com/andreab67/ai-models-pricing。生产实例运行在我们的 Kubernetes 集群上。如果你希望获得部署帮助,或将其集成到你自己的成本告警流水线中, reach out