每月 400 美元的云账单,本质上只是用来跑一个个人聊天机器人,曾经看起来还算合理。直到你意识到,同样的工作负载可以跑在一块你已经拥有的二手显卡上,每天的电费不过几分钱。本地 AI 成本栈早已不再是纸上谈兵。对于那些把 AI 视作日常基础设施、而非偶尔为之的差事的人来说,它是一种截然不同的经济模型。一旦你看清其中的层级,前路就会出奇地清晰。
第一层是硬件底线,比大多数人想象的要低。一块翻新版的 RTX 3090,即便已有两三年历史、在游戏玩家眼中早已过时,仍然可以以可用的速度运行量化后的 700 亿参数模型。一台搭载统一内存的 Mac Studio 也能以更少的折腾处理类似负载。这笔资本支出只是一次性投入,且分摊起来很快;折旧曲线也很平缓,因为这些显卡可以在同样的用途上服役长达十年。
第二层是模型本身。在大多数人的实际任务上——撰写、摘要、分类、从杂乱文本中抽取结构化数据——开源权重模型的进步速度惊人。你并没有将就,只是在选一款契合自己硬件预算的模型,而不是租用别人的算力。量化变体以极少的质量损失换来大幅的显存节省,对于个人本地栈来说,几乎总是值得的取舍。
第三层是运行时与编排软件。llama.cpp、Ollama、vLLM 以及类似的项目,已经把模型服务变成了一行命令的事。一旦模型在本地跑起来,把它开放给你自己的工具就是最简单的一步。各种自定义技能——那些把“总结这份 PDF”变成一次按键的小自动化——接入本地端点的方式,与接入托管端点毫无二致。集成成本基本为零。
第四层是工作流设计。人们常犯的错误,是把本地 AI 当作云端的替代品去复刻每一种低效。本地栈真正的优势在于:缓存重复出现的提示、批量处理相似任务、把较重的任务放到夜深人静时运行,那时没有人等着 GPU 出结果。本地栈会以云端从未有过的方式,回馈你一点工程上的用心。
第五层,也是大多数人跳过的一层,是度量。追踪你的真实使用情况。大多数个人 AI 用户只动用了可用算力的极小一部分。一旦你看到真实的数字,这笔经济账就再也无法忽视。
如果你感兴趣,可以从小处起步。下载一个开源权重模型,用你手头已有的任何一台机器运行它,然后把一个个人工作流指向它。社区的测评与基准数据都不错,但唯一重要的指标,是它能否真正完成你的工作。如果你需要,云端依然还在那里。但对于个人本地栈真正在做的绝大多数事情而言,云端是用不上的。
