2026年6月24日

别再为 AI tokens 支付过高费用:让我们的账单降低 90% 的本地模型技术栈

作者:Andrea Borghi
别再为 AI tokens 支付过高费用:让我们的账单降低 90% 的本地模型技术栈

六个月前,我们托管语言模型的月账单高得让财务部门开始追问。如今,它只有当时的十分之一,而且这些模型在我们的硬件上运行得比通过公共互联网时快得多。我们没有去谈折扣,也没有切换到更便宜的套餐。我们把模型搬回了本地。

这一转变最初只是一次实验,后来发展成了一套技术栈。如今,一组精心挑选的开源权重模型运行在网络边缘的一台消费级设备上,就能处理我们大部分的推理流量。云端模型仍然在工作流中,但只用于真正需要它们的任务。其他一切都在本地运行,节省的成本直接转化为利润。

第一条经验是,并不是每个提示都越大越好。一个 70-billion-parameter model 确实令人印象深刻,但对于常规摘要、分类和结构化提取来说,它的能力严重过剩。我们分析了真实流量,发现大约十分之七的请求都属于常规任务。一个经过微调的 7-billion-parameter model 以极低的延迟和零按 token 成本就能处理这些请求。按任务而不是按习惯来路由,才是关键突破。

第二条经验与硬件有关。我们原以为需要一整机架的加速器。实际上,一块现代 GPU,只要有足够的 VRAM 能同时容纳两到三个量化模型,就已经能轻松覆盖我们的峰值负载。将权重量化到四位带来了可测但可接受的质量下降,却为我们释放了大量内存和吞吐量。对于低优先级任务的长尾需求,一个仅 CPU 的备用方案配合更小的模型,确保了 GPU 忙碌时系统依然保持响应。

第三条经验是缓存。每次反复重新计算同一个上下文窗口时,token 成本都会累积。我们在推理层前增加了语义缓存,这样几乎重复的提示可以直接返回已存储的响应,而无需触碰模型。再结合会剥离多余历史记录的提示模板,几周内缓存命中率就提升到了 40% 以上。

第四条经验是可观测性。没有按模型延迟、每百万 token 成本以及质量抽检仪表盘,优化就只是猜测。我们为每一次调用都加上了监测,这样就能准确看出哪些路由是盈利的,哪些路由在悄悄消耗预算。

如果你正盯着一张已经无法匹配其价值的模型账单,那么路径其实很直接。分析你实际发送了什么,按任务为模型准确匹配规模,积极进行量化,缓存重复内容,并持续、严格地衡量。云端依然保留给最难的情况。其他一切都可以在你自己的桌面上运行。

想知道按这种方式路由后,你的流量会是什么样子吗?回复你最主要的三个模型使用场景,我们会分享我们会先采用的路由拆分方案。