2026年6月22日

本地 AI 模型和自定义技能如何将 Token 成本降低 90%(以及我们为何切换)

作者:Andrea Borghi
本地 AI 模型和自定义技能如何将 Token 成本降低 90%(以及我们为何切换)

我们从托管模型提供商收到的上一张月账单是 $4,200,其中几乎一半的支出我们无法追溯到任何客户成果。就是这单独一项,促使我们重建内部代理思考、路由和为智能付费的方式。三个月后,我们运行得更精简、更快速,也更便宜——而这套方法比会议巡回上讲得要简单得多。

第一步改变,是承认并非每项任务都值得用前沿模型来处理。把简单的分类、格式化和 schema 检查路由到一个小型本地模型后,我们在不牺牲关键准确性的前提下,处理了大部分工作量。我们把昂贵的托管调用留给真正困难的推理工作——战略框架、细致综合,以及边缘案例。这个原则并不花哨,却很有力:让调用成本与答案价值相匹配。

第二步改变,是把代理技能当作代码,而不是聊天。每项技能都是一个小而可测试的函数,拥有明确的输入和输出。当一项技能定义清晰时,一个微小的本地模型就能可靠地执行它,而且我们可以缓存结果。随着一周周过去,这些缓存的以及本地提供的调用,正是节省不断累积的地方。托管模型变成了备用方案,而不是默认选项。

第三,我们把 token 当作预算来衡量,而不是虚荣指标。我们跟踪每个工作流中每个已解决任务的成本,并拒绝上线任何没有超过基线的内容。这迫使我们坦诚讨论:哪些提示词真的在发挥作用,哪些只是为了填充内容而付出了高价。我们管道里有相当多的“智能”其实只是重复性的模板话术,而一个 7B 参数模型完全可以轻松处理。

第四,我们让每个代理都能有意识地升级处理。以本地优先为起点,并在置信度较低时,拥有一条清晰、文档化的路径去调用更强大的模型。团队信任这个系统,因为这个逃生通道是真实存在的;预算也信任这个系统,因为大多数调用根本不会走到那一步。

最后,我们不再为了演示效果而优化,而是开始为周二下午 2 点的实际场景优化。真实工作流、真实延迟预算、真实成本上限。正是在这里,本地模型和纪律严明的技能设计,真正体现了它们的价值。

如果你正盯着一个使用情况仪表盘,却发现它与团队交付的价值对不上,那么接下来的路不是再去谈一轮合同。先从梳理你调用量最高的请求开始,把简单的本地路由,把其余部分形式化为可复用的技能,并为每个工作流设定一个真实的单任务成本数字。90% 的降幅并不是营销说法——当你不再为琐事支付前沿模型价格时,它自然就会出现。

想要一份我们用来在投入基础设施之前寻找容易见效改进的入门审计清单吗?订阅后,我们会在周五发送那份一页式工作表。