瑜伽里有一条安静的原则,意外地也很适用于技术:只付出当下所需的努力——不多不少。如今大多数使用 AI 的团队都在反其道而行之。他们在每一项任务上都投入了最大的努力,不管是否真的需要,并且还按 token 一次次为这种特权买单。
我们来谈谈为什么你的 AI 成本一直在攀升——以及如何把它们拉回到更有意图的状态。
前沿模型就是为消耗 token 而设计的
Anthropic 和 OpenAI 的前沿模型确实令人印象深刻,而其中很大一部分 原因 在于,新一代模型在每次请求中做的工作本来就更多。它们会一步一步推理。回答前会“思考”。它们会运行更长、更多步骤的 agent 循环。它们给出的是详尽、谨慎、上下文丰富的回复。
这对用户体验来说是实实在在的提升。答案比几年前那些简短模型更好、更稳妥,也更有能力。但这也带来了一个值得明确指出的结构性副作用:
这些模型按 token 定价,而且它们就是被设计成会使用更多 token 的。
更多推理、更多输出、更多来回交互——这些都提升了体验,同时也增加了消耗。向你出售 token 的人和你这个买家的激励方向并不一致。最后你会为了本来只需要一句话回答的任务,付出深度思考的费用。
这对企业到底意味着多少成本
在一次单独的聊天里,成本几乎看不见——只是几分之一美分。问题在于规模。
- 一个每天处理 50,000 条消息的客户支持流程。
- 一个生成数百份草稿的内容流水线。
- 一个内部 agent 在每个任务上循环五六次,只为“把问题想透”。
把每次调用的 token 用量乘以推理开销,再乘以量级,再乘以 30 天。一个在演示里看起来便宜得几乎可以忽略的流程,会变成一项严肃、持续的运营支出——而且每当你增加一个功能或一个客户,它就会继续增长。更糟的是,它还 不可预测:这个月突然决定多想一会儿的模型,会悄悄抬高你的账单,而没有任何人发布一行新代码。
对于小型或中型企业来说,这种不可预测性才是真正的税负。
本地替代方案:Ollama
思路上的转变在这里。并不是每项任务都需要前沿模型。 事实上,大多数任务都不需要。
Ollama 让你可以在自己的硬件或一台普通服务器上直接运行有能力的开源模型——Llama、Mistral、Qwen 以及许多其他模型。只要它开始运行,请求的边际成本就会降到接近于零。你已经为计算资源付过费了;不会再有按 token 计费的表在跳动。
代价是,本地 7B–30B 模型在整体能力上不如前沿模型那么强。但对于定义清晰、可重复的工作——分类、信息抽取、摘要、路由、基于模板的起草——更小的本地模型完全够用。关键在于知道哪些任务留在本地,哪些任务升级处理。
AnythingLLM 的自定义技能:真正的杠杆
大多数节省都来自这里。
AnythingLLM 是一款开源应用,它通过 Ollama 将本地模型封装在一个带有文档/RAG 支持的干净工作区中——而且至关重要的是,它提供了一个 自定义技能 系统。你不再要求模型每次都从零开始推理同一个任务,而是把工作中可重复的部分编码成一个确定性技能:真实代码,稳定运行,调用你的 API,格式化输出,并且只把真正模糊的决策交还给模型。
结果就是一个混合方案:
- 确定性代码 负责繁重、可重复的工作——每次都一样,而且免费。
- 模型 只在任务中真正需要判断的那一小部分被调用。
你得到的是相同的最终结果,却消耗了更少的 token——因为你不再付费让语言模型重新推导一个你早已知道的流程。
MCP 服务器在这里扮演什么角色
一个小型本地模型的价值,取决于它能 接触到 什么。这就是 MCP(Model Context Protocol)服务器 的作用。
MCP 是一个开放标准,用于把 AI 模型连接到工具、数据和实时系统——数据库、文件存储、内部 API、工单系统、你的 CRM。AnythingLLM 支持 MCP 服务器,这意味着你的本地技术栈不是一个封闭的聊天机器人;它是一个能够通过干净、标准化接口读取真实数据并执行真实操作的 agent。
这正是让本地方案能够胜任严肃工作的原因。前沿模型提供商希望你把一切都放在他们按 token 计费的上下文窗口 内部 完成。MCP 让你把数据、工具和确定性逻辑保留在自己这边——而只为真正的思考付费。
实用技巧:把一个标准技能重写为优化后的自定义技能
下面是如何把你目前交给前沿模型处理的任务重建为只需极低成本运行的方式。
先分析你的 token 支出。 找出运行最频繁的 3–5 个工作流。节省成本就是在这些地方累积起来的。不要去优化一个你每周只跑两次的东西。
把确定性部分和模糊部分拆开。 逐步查看模型在每次调用中实际做了什么。每次都一样的部分——获取数据、应用格式、验证字段、路由——根本不需要语言模型。
把确定性部分移到代码里。 在 AnythingLLM 的自定义技能中,这些逻辑会变成一个 handler 函数。它每次都完全一致地运行,没有 token 成本。
把 prompt 缩减到决策本身。 只把真正模糊的问题交给模型,并提供足够的上下文让它回答即可。不要每次都把整个流程重复一遍。输入更少、输出更少、账单更少。
通过 MCP 拉取实时数据,而不是塞进 prompt。 不要把一个 4,000 token 的文档直接贴进上下文;如果一个 MCP 工具可以按需精准获取你需要的字段,就让它去做。
按难度分流。 日常版本运行在本地 Ollama 模型上。把前沿模型留给真正困难的那 5%——并让你的技能决定何时升级。
衡量前后差异。 跟踪任务前后的 token 使用量。做这件事的团队通常会发现,他们最高频的工作流能减少 80–95% 的消耗。
有意图的结论
前沿 AI 值得付费——当任务确实需要它时。错误在于把它当作所有事情的默认选择,并在不知不觉中为一个按 token 计费、而且设计上就是会持续上涨的计量器买单。
把常规工作放到本地运行。把可重复的内容编码成自定义技能。用 MCP 连接真实世界。把前沿模型留给真正需要它们的时刻。
这不是偷工减料。这只是为当下使用恰当的努力——而这件事,恰好也是在瑜伽垫上和云端里都很好的实践。
