上个月,来自某托管模型服务商的账单达到了 4,200 美元,其中近一半的支出我们无法追溯到任何具体的客户成果。正是这单一项目,迫使我们重新构建内部智能体的思考、路由与算力付费机制。三个月过去,我们的运行变得更轻、更快、更便宜——而这套方法论,远比大会上所宣扬的更为简洁。
第一个转变,是承认并非每个任务都值得使用前沿模型。我们将简单的分类、格式化和结构校验等任务路由到一个小型本地模型,从而在不损失关键准确性的前提下处理了大部分流量。我们只为真正棘手的推理工作——策略框架构建、细致入微的综合分析以及边缘案例——保留昂贵的托管调用。这一原则朴实却强大:让调用的成本匹配答案的价值。
第二个转变,是把智能体技能视为代码而非对话。每个技能都是一个小型、可测试的函数,具备明确的输入与输出。当技能定义清晰时,一个微小的本地模型就能可靠地执行它,我们还能对结果进行缓存。放在一周的时间维度来看,正是这些被缓存和本地处理的调用,让节省效应得以复利累积。托管模型由此变成了后备选项,而不再是默认之选。
第三,我们像管理预算一样衡量 Token,而非将其作为虚荣指标。我们追踪每个工作流中每个已解决任务的单次成本,并拒绝发布任何无法跑赢基线的成果。这迫使我们展开坦诚的对话:哪些 Prompt 真正在发挥作用,哪些只是在为填充内容支付溢价。令人惊讶的是,我们流水线中大量的所谓「智能」其实是重复性的样板工作,一个 70 亿参数的模型就能轻松胜任。
第四,我们赋予每个智能体「主动升级」的能力。本地优先,但同时配备一条清晰、有据可查的路径,使其在置信度不足时能够切换到更强的模型。团队信任这套系统,因为「逃生通道」真实存在;预算也信任这套系统,因为绝大多数调用从未真正用到它。
最后,我们停止了为「演示效果」做优化,转而聚焦于「周二下午两点」的真实场景。真实的工作流、真实的延迟预算、真实的成本上限——这才是本地模型与严谨的技能设计真正发挥价值的地方。
如果你正盯着一份与团队产出价值无法对账的使用仪表盘,前路并不在于又一轮合同谈判。请从梳理高调用量的请求开始,把简单的任务本地化处理,把其余任务沉淀为可复用的技能,并为每个工作流标注真实的单任务成本。90% 的成本削减并非营销话术——当你停止为琐事支付前沿模型的价格时,这是自然而然的结果。
想要一份我们用于「在投入基础设施之前快速锁定容易摘到的果实」的入门级审计清单吗?订阅我们的内容,我们会在周五把那份一页纸的工作表发给你。
