写作

一年前的前沿,今天塞进了你的显卡

2026-08-128 分钟
一年前的前沿,今天塞进了你的显卡

杂货铺 · 第9篇

欢迎来到我的小铺,今天聊聊大模型本地部署的发展现状。

今日看完了扎克伯格在 WSJ 发的一篇长文,14 页,核心就一句话:个人 AI 助手是正经路线,不是退而求其次。同一天,Meta 发布了 Muse Glimmer 30B,30B 参数,开源,4-bit 量化后不到 20GB,塞进一张显卡就能跑。相信已经有大量的测评产生,我就不追热点了。

看文章的时候想起近期刚看到的一份报告——OpenAI 发布了《Signals: From Asking to Doing》,数亿 ChatGPT 用户的真实使用场景,第一次被摊开来看。报告里有个数据挺有意思:跟扎克伯格发的那个 30B 本地模型凑到一起,就引出一个问题——大多数人的日常场景其实对模型能力的要求并不高,那本地能跑的小模型,够不够用?

还有今年英伟达发布会上黄仁勋掏出的 RTX Spark 笔记本,128GB 统一内存,说是"重新发明的 PC"——这些事情凑到一起,我感觉看到了一条模糊的线路。

本地部署大模型这条线我从去年开始就一直在跟,Qwen、MiniMax、GLM、DeepSeek 等,量化后 300B 以内的开源模型基本都试了个遍,相关的 LLM 工具链也摸了一遍。不是为了追热点,是真的好奇:我确实想拥有一个只属于自己的"贾维斯"。

这个问题的答案,最近开始变得清晰了。但市面上的声音大多在讲"什么硬件跑什么模型,跑出什么效果",看着挺热闹。实际从操作层面来看,远没那么简单。

· · ·

先说扎克伯格这篇长文。

他讲了三条,我挑要紧的说。第一,个体赋能是繁荣的源头,AI 不该走中央计划的路子——不是把所有算力和智能攥在几家巨头手里,然后给每个人发个"统一分配"的助手。第二,AI 的目的是帮人发明和创造,不是把人的活全自动化了,然后靠全民基本收入养着。第三,安全靠权力分散,不靠一个开明的好人——这是 Meta 重押开源的原因。

说白了,他的判断是:个人 AI 助手不是云端大模型的"低配平替",而是一条独立的路线。真正了解你、理解你的目标、能帮你实现目标的个人超级智能,才是最有用的。

这话听着像在给自家产品打广告,但结合 Meta 同步发布的那个 30B 开源模型来看,他不是光喊口号,是真金白银在做。一个 30B 的模型,开源,量化后不到 20GB,MacBook 或者一张消费级显卡都能跑——这是在给"个人本地 Agent"这个路线铺地基。

扎克伯格的判断,其实跟大多数人的直觉一致——个人当然需要本地跑模型。隐私、可控、不依赖网络,这些道理不用多讲。真正挡在路上的不是"需不需要",而是硬件价格。一台能跑 30B 模型的设备,少说也要一两万,多则三五万。有这笔钱,买云端 API 能用好几年,而且云端模型还在不断进步,你买的硬件却会过时。这笔账,大多数人算完都会觉得不划算。

但扎克伯格赌的就是这件事会变。模型在变小,硬件在变强,两条线总会交叉。那交叉点到了没有?这得用数据说话。

· · ·

OpenAI 那份《Signals: From Asking to Doing》报告,数亿 ChatGPT 用户的真实使用行为,第一次被深度分析。报告里的数据,挺出乎意料。

网上声量最大的群体,是在用 ChatGPT 写代码、做分析的,但真实数据是:80% 的使用场景落在实用指导、信息检索和写作上。写作占了工作场景的 40%,而其中三分之二不是从零开始写,是修改现有文本——编辑、润色、翻译。编程只占 4.2%——当然,这个数字没算 API 调用和 Codex 这类编程工具的使用,真正的编程场景肯定比 4.2% 高不少。但数亿用户在网页端的主要用途,确实就是这些日常活:查信息、写东西、改文字。

这笔账可以这么算:如果一个人日常用 AI,主要就是查个信息、写个邮件、改段文字,那他需要的模型"智商"其实没那么高。2025 年中前后的前沿模型——GPT-5、Claude Sonnet 4.5 那个水平——已经能把这些活干得很好了。

而现在 27-30B 的本地模型,体感大约就对标那个水平。拿 Qwen3.6-27B 和 Muse Glimmer 30B 来说,GPQA、AIME 这些跑分已经摸到了一年前前沿模型的门槛。Qwen 的 Artificial Analysis 智能指数 37 分,Muse Glimmer 在同尺寸模型里也排到了前列,而价格是 0——本地免费。

一年前的前沿模型,今天塞进了你的显卡里。

这不是某一个人的体感判断。有测评者把本地模型这两年的进展画了一条线:一年之内,本地模型从"两年前的前沿"跨到了"一年前的次前沿"。差距还在,但差距在以年为单位缩小。

· · ·

具体到模型,现在可以分两档来看。

第一档:27-30B,个人单卡就能跑。

Meta 刚发的 Muse Glimmer 30B 是个引子,30B 参数,开源,量化后不到 20GB,MacBook 或者一张消费级显卡都能跑。国内更有感知的是 Qwen,3.6-27B 已经是社区公认的本地"甜点尺寸"——24GB 显存能跑,编码能力在开源模型里顶到天花板。

这些模型现在到底什么水平?得有个参照系。

Claude Opus 4.6,今年 2 月发布,算是一个标准的守门员。它已经不是最新的了,但从它开始,模型才真正具备了自主接管整个任务的能力——不用人一步一步盯着,它自己规划、自己执行、自己纠错。可以说从这一版开始,以前大火的编程工具 Cursor 那套"人盯着 AI 一步步走"的范式就过气了。

换句话说,Opus 4.6 是一道分水岭:迈过去的模型,才算是能"干活"的模型。国产模型以前不太能打,核心原因就是对标不了这个段位。而本地模型不用说超越,只要能接近它的上一个版本,就已经非常能打了。

Qwen3.6-27B 就是个例子。GPQA Diamond 87.8,AIME 2026 数学竞赛 94.1——这些跑分在一年前只有前沿模型才摸得到。对普通人来说,查信息、写东西、改文字,绰绰有余。

第二档:往上走一步,发烧友或中小企业级别。

DeepSeek V4 Flash 是目前最值得说的。284B 总参数,但 MoE 架构每次只激活 13B——相当于一个 284 人的团队,每次只派 13 个人出来干活,既保持了总实力,又不用所有人都到场。这个设计让它在"聪明"和"跑得动"之间找到了一个很巧妙的平衡点。

今年 7 月 31 号的正式版,通过一轮重新后训练,Agent 能力直接暴涨——DeepSWE 从 7.3 分跳到 54.4 分,7.5 倍提升;Terminal Bench 82.7,Cybergym 安全攻防 76.7。9 项 Agent 基准全面反超了自家的 V4 Pro 预览版——那个是 1.6T 参数、49B 激活的大家伙。

第三方 Artificial Analysis 给了 50 分,只比 GPT-5.6 Luna 低 1 分。OpenRouter 近期调用量 7.22 万亿 Token,全球第一。社区里有人画了张散点图,说 V4 Flash 在 0.025 美元、50 分的位置画了一条"斩杀线"——比它贵而且不如它聪明的模型,"商业上再没有理由存在"。

当然,部署门槛不低。我 256GB 内存才能开满 1M 上下文。社区有人用 8 张 RTX 3090 搭了台机器,192GB 总显存,跑量化版模型文件 155GB,首字时延 680 毫秒,生成速度约 39 tokens/s。硬件成本大约 6.5 到 6.9 万元。

这个价格已经不完全是个人消费级了,但对于中小企业、工作室、甚至有特定需求的部门来说,是一个真正可以坐下来算账的选项。

· · ·

所以扎克伯格的路线和 OpenAI 的数据,凑到一起,就指向同一个判断:大多数人的日常需求,本地模型已经能接住了。不是"凑合用",是那个水平本来就够了。

但"能接住"和"能用好"之间,还隔着一道沟。

这道沟,不是模型智商的差距。大多数人以为本地和云端的区别就是"聪明"和"不太聪明"——跑分低一点,回答差一点,凑合用。但实际操作下来,真正的坑全在工程层面:显存装得下不等于跑得快,瓶颈是带宽不是容量;冷启动要等模型加载;上下文一长内存就吃紧;Agent 框架和本地模型之间的协议经常对不上。各路测评把模型装上去问个"你好"就打分,但真正用起来才知道水深。

这些坑每一个都能单独展开说,以后有机会单开一篇聊。但这里想说的是另一面:这些坑,正在被逐步填上。

大显存的设备开始有了,虽然诚意还不够。英伟达的 RTX Spark,128GB 统一内存,说是"重新发明的 PC",但厂商目前还只是试水,性价比和诚意都谈不上足。与其等它的下一代产品,不如看看市面上已有的设备哪些合适。而且说实话,硬件市场的窗口期可能不会一直开着——去年 6 万块能买到的 RTX 6000 Pro,现在涨了差不多六成,DRAM 在涨价,厂商也很难顾及个人消费者这个市场。不是最好的时机,但越往后可能越不好。

适合本地跑 Agent 的模型也越来越多了。27-30B 这一档,Muse Glimmer、Qwen3.6-27B 已经能跑,能力对标一年前的次前沿模型。再往上,DeepSeek V4 Flash 这种 284B 总参只激活 13B 的 MoE 架构,Agent 能力暴涨,9 项基准反超自家 1.6T 的 Pro 版,已经到了真正可用的级别,只是部署门槛要 96GB 起步。

模型在变小,硬件在变强,坑在被逐步填上——三条线同时在动。

· · ·

所以我看到的是什么?

市场会分两层。80% 的大众,日常用 AI 就是查信息、写东西、改文字,本地模型已经够用,没必要每月给云端交订阅费。20% 的专业用户——做开发的、跑 Agent 的、需要最新最强能力的——继续用云端前沿模型,那 1% 的能力差距对他们来说是刚需。

这不是预测,是三个维度指向同一个方向:扎克伯格用真金白银押注"个人本地是正经路线",OpenAI 用数亿用户的数据证明"80% 场景不需要前沿模型",跑分数据确认"一年前的次前沿水平今天塞进了显卡"。

当然,本地部署的坑还很多,硬件也不便宜,窗口期可能说关就关。但方向是清楚的。先写下来,至于准不准,以后再说。