
欢迎来到我的小铺,今天继续聊本地大模型部署。
前三篇聊的都是我自己怎么折腾——硬件怎么选、软件怎么调、部署怎么试。这一篇想聊聊:
为什么我觉得现在这个时间点,本地部署终于值得折腾了。
一、阈值到了
先说数字。
我的双机 DGX Spark 部署 V4 Flash(Q4 量化,vLLM 引擎),日常使用场景下,稳定在每秒 40 到 60 个 token。跑双路并发的话能超 80。百万 token 的上下文,预填充速度约 875 token/s。
这几个数字放在一起,意味着什么?
意味着本地跑大模型这件事,跨过了一个门槛。
以前在本地跑模型,上下文一旦超过 128K,性能就明显不够用了。128K 能干什么?问答、润色、一问一答——本质上是一个 Chatbot。你问一句它答一句,对话历史稍微长一点就撑不住。
但现在是 Agent 时代。
Agent 不是一问一答,它要记住你的需求,拆解任务,调用工具,保存中间结果,每一步都在消耗上下文。
Agent 时代至少 256K 起步,日常 512K 比较够用,1M 能塞下一整本书或一个代码仓库。
以前在本地,这些数字想都不敢想——不是模型不行,是上下文一长,速度就崩了。
V4 Flash 在 DGX Spark 上跑出了 40-60 token/s 的稳定速度,还能撑住 1M 上下文。
这不是“勉强能用”,是真正能跑 Agent 了。
本地部署跨过了从“玩具”到“工具”的阈值。

二、为什么是现在
DGX Spark 这台机器,从公布到上市折腾了一年多。前期甚至经历过价格雪崩——上市半年就有人甩卖,因为买回来发现跑不动什么像样的模型。
原因不只是模型不够强。它内存带宽只有 273 GB/s,对比同时期的 Mac M3 Ultra 是 819 GB/s,差了将近 3 倍。
推理速度的天花板是带宽,这个前面聊硬件时说过。带宽太低,大的稠密模型跑起来就是慢。早期在 DGX Spark 上跑个 70B 的稠密模型,每秒十几个 token 都算快的,跟读电报似的。
而当时能装进 128GB 内存的模型,要么是量化到面目全非的中等模型,要么是跑得磕磕绊绊的大模型。算力倒是够——它的算力比 M3 Ultra 强不少。但推理不是只靠算力,带宽跟不上,算力就是空转。
说白了,它是一台“啥都能装下,但啥都跑不快”的机器。
花几万块买这么一个东西,到生产力环节,各项能力都明显不足。
V4 Flash 出来之后,情况变了
这是一个在能力上真正“能打”的模型——推理、写代码、做数学,放到云端也不丢人。
更关键的是,它是 MoE 架构,每次推理只激活一小部分参数,对带宽的压力比稠密模型小得多。
当模型本身值得用的时候,优化的价值就出来了。
社区花精力做量化、做推理引擎适配、做 KV Cache 优化,每一步提速都有意义了。
所以不是机器突然变强了,也不是谁突然发力了。
是模型到了一个临界点,社区的优化意愿被激活了。
优化的人多了,速度就上来了;速度上来了,能用的人就多了;用的人多了,反馈和迭代就更快。
模型和社区,是互相带动的。
三、一个模型一夜长出生态
这个“互相带动”的速度有多快?说说近期最热的一个例子。
上个月,MiniMax 开源了他们的视频生成模型 H3。接下来发生的事,比模型本身还值得看。
24 小时内
开源 24 小时内,超过 100 家企业完成了适配——16 家芯片厂商当天交了作业,华为昇腾、AMD、Intel、摩尔线程……一堆厂商抢着让自己的芯片能跑这个模型。
英伟达自己的研究团队更夸张,4.5 小时就交出了第一轮推理优化。
一周之后
社区衍生出近 300 个模型变体。有人做了 Turbo LoRA,把采样步数从二十步压到 4 到 8 步,提速 5 倍。
ComfyUI 的社区重打包版,下载量逼近 700 万次——比官方原版还高。
一个人干了一个团队的活
还有一个让我印象深的:Redis 的创建者,一个人,从零给 Mac 写了一个原生推理引擎。
H3 的推理代码跑在 Python 和 PyTorch 上,依赖 NVIDIA 的 CUDA 生态,就像一本只翻译成了英语的书,Mac 看不懂。这位老兄用 C 语言和 Mac 自带的图形接口把推理链路整个重写了一遍,直接读权重文件,打包成一个双击就能跑的程序。
一个人干了一个团队的活。
社区从各个维度把 H3 往“能用”的方向推
这些事不是 MiniMax 安排的,也不是谁下发了任务。模型够强,大家觉得值得折腾,就动手了。
最直观的是速度:有人做了 Turbo LoRA,把采样步数从二十步压到 4 到 8 步,提速 5 倍——原来等一杯咖啡的时间,现在等一口咖啡就行。
内存方面,全精度要吃掉 123GB,社区裁权重、做量化、写定制 kernel,硬是压到 42GB——以前要 A100 级别的专业卡才够,现在两千块钱的桌面显卡也能上手。
质量方面,有人训练了专门的人物真实感 LoRA,让生成的人物不再像蜡像。
而且这个优化还没到头。量化方案还在出新的,加速方案还在迭代,2K 分辨率的本地输出方案社区也在尝试。
没有谁宣布“这就是最优解了”,因为确实还没到。
四、厂商不是跑不快,是优先级不同
看到这你可能会问:这些优化,厂商自己做不就行了?为什么要等社区?
不是做不了,是优先级不同。
厂商的资源是有限的,他们要干的事太多了——训练下一代模型、迭代架构、搭建平台、谈合作。每一个都比“把推理速度再提 15%”重要得多。
这不是偷懒,是分工。
厂商的核心能力在“造模型”,社区的核心能力在“用模型”。厂商把模型造出来、开源出来,剩下的事——量化、加速、适配各种硬件、做工具链——自然有人来干。
不是一两个人,是一群不认识的人,各干各的,各取所需。
开源最狠的地方不是“免费”,是“借势”。
你把一个好东西放出去,几百双手同时帮你改进,你不用发工资,不用排期,不用开周会。这帮人图什么?有的图名气,有的图学习,有的就是觉得好玩。动机不重要,结果很重要。
当然,这个“借势”有个前提:
模型得够强。
模型不行,没人愿意花时间帮你优化。社区很诚实,它用脚投票——好东西一夜长出生态,平庸的东西连个讨论帖都没有。
五、回到换 Mac 的那笔账
硬件篇聊过一笔账:我为什么出掉了 Mac,换成了 DGX Spark。当时算了两笔——Mac 硬件确实更好,但要专职机;想跑视频,只有 NVIDIA 生态能同时满足。
这两笔账其实还差一块拼图。
硬件强不等于生态强
Mac 的硬件确实强——带宽 819 GB/s,是 Spark 的三倍,统一内存,256GB 顶配。
但前面说的那些社区优化——Turbo LoRA、ComfyUI 定制 kernel、各种量化方案——绝大多数集中在 NVIDIA 的 CUDA 生态上。
不是 Mac 没人管,Redis 的创建者给 Mac 写了原生引擎,Mac 也有 MLX 框架支持。但社区火力的覆盖面,Mac 远不如 NVIDIA。
一边是几百人在同时干,一边是几个高手在零星干。
差距不是硬件能补的。
第三块拼图:社区火力
这就是第三块拼图:社区火力。
选机器不只是选硬件参数,是选你站在哪个生态里。Mac 的硬件再好,站在一个社区火力覆盖远不如的生态里,能跑的东西就少,优化就慢,等社区跟上来要花更多时间。
DGX Spark 这边也有人在做 H3 的优化项目,不过目前还不太成熟,我在等后续进展。未来可期——模型和社区互相带动的循环已经转起来了,只是 Spark 这边还需要时间。
所以我选 DGX Spark,不是因为它硬件更好——它硬件确实不如 Mac。
是因为站在 NVIDIA 的生态里,社区帮我干的活最多。
六、折腾到底图什么
写到这里,四篇快收尾了。回头看看,选机器、调参数、踩坑、看社区——折腾了这么多,到底图什么?
直接调 API 不香吗?开箱即用,不用买机器,不用调参数,不用半夜排查报错。说实话,大部分场景,API 确实够用。
但本地部署有一些 API 给不了的东西。
数据不用出门
我平时会把一些工作文档、私人笔记喂给模型处理,这些东西我不想传到云端服务器上。本地部署,数据从头到尾在自己机器里,不用担心哪天平台泄露了、或者拿我的数据去训练下一代模型了。
这不是什么高深的道理,就是图个安心。
用起来不受制于人
调 API,你受制于网络、受制于平台的限流策略、受制于接口随时可能变更。
本地部署,模型跑在自己机器上,断网也能用,没有调用次数限制,不用担心哪天服务突然下线或者涨价。
你对自己的工具有了真正的控制权。
长期成本可控
API 按 token 收费,用得越多越贵。本地部署是一次性硬件投入,之后跑多少都不额外花钱。
光算文字 API 的费用,跑几个月确实回不来本。但我不只是用它跑文字——还拿它跑图、跑视频,这些要是走云端 API,开支不小。加上这些,用得足够多的话,回本是能做到的。
最值钱的,不是这些
但我觉得最值钱的,还不是这些。
是通过这台机器,我摸清了大模型到底是怎么跑的。
调 API,你用的是黑盒——输入进去,答案出来,中间发生了什么你不知道。
本地部署不一样,从显存怎么分、带宽怎么用、模型怎么量化、KV Cache 怎么调,每一步你都得过手。过完一遍,你对“大模型怎么运行”这件事,有了一个从底层到应用的整体感觉——不只是知道它能用,还知道它为什么能这样用,哪些地方可以调,调了会怎样。
这种感觉不能变现,写在简历上也没人看。但它改变了你跟 AI 的关系——
以前你是把问题塞进黑盒等答案,现在你知道答案在机器里走了哪条路。
从“调用者”变成了“理解者”。
一张往更深处走的入场券
而且这只是起点。
摸清了模型的运行机制,下一步我就开始琢磨 Agent 了——怎么让模型记住任务、拆解需求、调用工具、保存中间结果。这些概念以前在文档里读过,但只有你自己跑过模型、调过参数、踩过坑之后,再去看 Agent 的设计思路,体会完全不一样。
本地部署给我的不只是一台能跑的机器,是一张往更深处走的入场券。
而且,我踩过的坑、试出来的参数组合,通过社区,可能就是下一个人少走弯路的石头。前面说的那些社区贡献者,他们也是这么干的——自己折腾完了,顺手分享出来。
社区就是这么长出来的。
哞小哞的杂货铺 · 2026 · 015