2026年6月22日

本地 AI 成本栈:如何在没有云账单的情况下运行自定义技能

作者:Andrea Borghi
本地 AI 成本栈:如何在没有云账单的情况下运行自定义技能

每月 400 美元的云账单,只为了一个本质上就是个人聊天机器人的东西,曾经会让人觉得还算合理。然后你会意识到,同样的工作负载可以跑在你已经拥有的二手显卡上,或者那些每天只消耗几美分电费的硬件上。本地 AI 成本栈不再只是理论。对于把 AI 当作日常基础设施,而不是偶尔才用一次的临时工具的人来说,这是一种不同的经济模型;一旦你看清这些层次,前进路径会出奇地简单。

第一层是硬件底线,而且比大多数人想象的更低。翻新的 RTX 3090,已经是两三年前的产品,在游戏圈里也过时了,却仍能以可用的速度运行量化后的 70B 参数模型。配备统一内存的 Mac Studio 也能更轻松地处理类似负载。资本支出是一笔一次性投入,但很快就能摊平,因为这些显卡在十年里都还能继续完成同样的工作。

第二层是模型本身。开源权重模型在大多数人真正会做的任务上进步很快:起草、总结、分类、从杂乱文本中提取结构化数据。你并不是在将就。你是在选择一个符合你硬件预算的模型,而不是花钱租用别人硅片上的算力。量化版本用少量质量损失换来大量内存节省,而对于个人栈来说,这几乎总是更合适的交易。

第三层是运行时和编排软件。llama.cpp、Ollama、vLLM 以及类似项目,已经把模型服务变成了一条命令就能完成的事。一旦模型在本地运行,把它暴露给你自己的工具就很容易了。自定义技能——那些把“总结这个 PDF”变成一次按键的小自动化——接入本地端点的方式,和接入托管端点没有区别。集成成本几乎为零。

第四层是工作流设计。人们常犯的错误,是把本地 AI 当成云的替代品,然后复制所有低效做法。真正的收益来自缓存重复提示、批量处理相似任务,以及在夜里没人等着 GPU 结果时运行更重的作业。本地栈会以云端从未有过的方式,奖励一点工程上的周到思考。

第五层,也就是大多数人会跳过的,是度量。跟踪你的实际使用情况。大多数个人 AI 用户只消耗了可用算力中的极小一部分。一旦你看到真实数据,这种经济性就变得无法忽视。

如果你感兴趣,可以从小处开始。拉一个开源权重模型,运行在你已经拥有的任何机器上,然后让它先服务于一个个人工作流。社区文章和基准测试都很好,但唯一真正重要的指标,是它是否能完成你的工作。如果你需要,云端依然在那里。对于个人栈真正要做的大多数事情来说,它其实并不需要云。