2026年6月24日

停止为 AI Token 过度付费:让我们账单缩减 90% 的本地模型技术栈

作者:Andrea Borghi
停止为 AI Token 过度付费:让我们账单缩减 90% 的本地模型技术栈

六个月前,我们每月为托管语言模型支付的费用,是一个会让财务部门追问的数字。如今只剩十分之一,而且模型在我们自己硬件上的运行速度,比它们通过公网时还要快。我们没有谈判折扣,也没有切换到更便宜的套餐。我们把模型带回了家。

这次转变最初只是一次实验,后来沉淀成了一套技术栈。一小批精心挑选的开源权重模型,运行在我们网络边缘的一台消费级主机上,如今承载了大部分推理流量。云端模型仍在体系内,但只用于那些真正需要它们的任务。其他一切都跑在本地,节省下来的费用直接体现在利润上。

第一个教训是:对每一条提示词来说,更大的模型并不总是更好。一个 700 亿参数的模型固然令人印象深刻,但对于日常的摘要、分类和结构化抽取任务而言,它远远被过度配置。我们分析了真实流量,发现大约十次请求中有七次是常规任务。一个经过微调的 70 亿参数模型就能以极低的延迟和零 Token 成本处理这些任务。按任务而非按习惯来路由,才是关键突破。

第二个教训关于硬件。我们曾以为需要一整排加速器。实际上,一块现代 GPU,只要显存足以同时舒适地容纳两到三个量化模型,就能完全覆盖我们的峰值负载。量化到 4-bit 权重会带来可察觉但可接受的质量下降,同时换回了巨大的显存和吞吐空间。对于长尾的低优先级任务,当 GPU 忙碌时,一个仅使用 CPU 的小型模型回退方案让系统依然保持响应。

第三个教训是缓存。当你反复评估同一个上下文窗口时,Token 成本会不断累加。我们在推理层前加入了一个语义缓存,让近似重复的提示词直接返回已存储的响应,完全不再调用模型。配合去除不必要历史的提示词模板,缓存命中率在几周内就攀升到了 40% 以上。

第四个教训是可观测性。如果缺乏按模型划分的延迟、每百万 Token 的成本和质量抽查看板,优化就只是猜测。我们为每一次调用都加上了埋点,这样就能清楚地看到哪些路由真正划算,哪些在悄悄烧掉预算。

如果你正盯着一个与所获价值不再匹配的模型账单,路径其实很清晰:分析你真正发送的内容、为任务匹配合适规模的模型、激进量化、缓存重复请求,并持续测量。云端留给真正棘手的任务,其余的都可以跑在你自己的桌面上。

想知道你的流量按这种方式路由后会是什么样子?回复你最重要的三个模型用例,我们会分享我们建议作为起点的路由拆分方案。