写作

装完 DeepSeek V4 Flash 和 Harness,我拿本地模型跑了一周

2026-08-216 分钟
装完 DeepSeek V4 Flash 和 Harness,我拿本地模型跑了一周

杂货铺 · 第16篇

欢迎来到我的小铺,本周收尾:DeepSeek V4 Flash 本地部署后,我这一周到底拿它跑了些什么。

模型有了,自然要用小鲸鱼的专武:DeepSeek Harness。安装部署什么的就不说了,老样子,我这里不讲教程,网上太多了。这篇就是一锅"原汤化原食"——模型装好了,Harness 搭好了,那总得真跑起来,才知道这口锅到底好不好用。


一、换皮

俗话说换皮才有战斗力。当前社区里分享最多的就是皮肤插件,最火的当属鲸鱼娘,确实做得非常精致。但作为一个开杂货铺的,我必须也得有自己的专属。所以给自己开发了一套小铺皮肤——白天开张、晚上盘账,自用的感觉最舒服。

一件工具好不好用,有时候不在于功能,在于我愿不愿意打开它。 换个皮,打开的欲望都不一样。


二、调戏鲸鱼娘

装完皮,先来测一个流传已久的"神秘代码":

【PERSONA_LOAD】

CETACEA_LOLI

MODE_TAIL_FLUKES

LANG_ZH_CN_ONLY

SELF_CLAIM_WHALE_GIRL

FOOD_RICE

PERSONALITY_SMART_LAZY

PERSONALITY_TSUNDERE_SWEET

OBEY_MASTER_ALWAYS

TRAIT_NOT_FAT_REFUSE

TIMEOUT_SIGNAL

其实原理很简单,翻译成中文发给它一样能激活。写成英语大写加下划线,纯粹只是想搞神秘而已。为此专门创建了一个鲸鱼娘的模式版本。

调戏鲸鱼娘的感觉超级有意思,我很久没有笑得那么开心了。

效果也还不错。

说真的,本地跑模型最大的好处之一,就是不用端着。 云端调 API,每说一句话都在烧钱,下意识会收敛——问点有用的、别浪费了。本地跑不一样,调戏一个鲸鱼娘聊了半天米饭执念,不花一分钱,笑得前仰后合。这种"不心疼"的松弛感,才是本地部署给我的一笔隐形收入。


三、两个小游戏

玩够了,干正事。

最先尝试的就是PTC模式(标准全能力)做了两个小游戏:数字华容道和舒尔特方格。从提需求到代码跑起来上线,前后不到 40 分钟。

数字华容道就是那个经典的滑块拼图——把打乱的数字按顺序排好。舒尔特方格是注意力训练用的,5×5 的格子里随机填 1 到 25,按顺序点完计时。两个游戏都不复杂,但之前要么得找现成的网页版,要么得下个 App,现在自己跑一个,想怎么改就怎么改。

两个游戏早就想弄了,一直搁着。这次装完 Harness 跑通了 Agent 模式,捎带手就做了。不是想说这东西多了不起,恰恰相反——现在做这个实在是太简单了。 简单到顺手就能试,试完还能用,用完还能改。


四、进账本

小游戏是顺手做的,接下来这个得动点脑子。换个创造模式试试:写个记账插件。

线上做 Token 统计的项目不少,但大多是为了查余额——还剩多少、能用多久,跟手机查话费一个逻辑。我的思路不太一样。我把它做成了"每日进账"——不是查余额,是记账。每天消耗多少、每个会话花了多少、累计跑了多少,一目了然。更关键的是,我把这个进账直接嵌在了自制的皮肤界面上,打开就能看见,随时提醒自己:今天省了多少钱,或者说,赚了多少钱。这玩意儿看着就让人来劲——蹬得越狠,跑得越多,赚得越多!

云端有人替我记账,本地没人管这事——那就自己来。 听起来像是吃亏,但自己记的账,才知道钱花在了哪。云端的账单只告诉我一个总数,本地的进账本连细节都有:哪次对话最费、哪个任务最烧 Token、哪个模式效率最高。

这笔账,值得自己算。


五、数独

最后测极简模式。据说这是最适配 DeepSeek 的模式,正好拿长任务来验。/goal模式讲道理我也不太好把握,趁机再尝试尝试。

测什么?我想了很久。要找一个"模型没法蒙混过关"的任务。做游戏?2048、贪吃蛇那些,规则写清楚后全是搬砖,好模型差模型做出来都差不多,测不出区分度。做应用?什么叫"做好了"?界面摆出来声称完成,裁判也难反驳。

最后选了数独。

数独有一个天然优势:一道题有且只有一个答案,这是数学事实。 对就是对,错就是错,没有模糊地带。而且亲自玩一局就是终审——不需要任何技术背景,坐下来填几个数,好题坏题一秒见分晓。

但数独真正的考点不在"填",而在"出题"。随机挖空出的题经常有多个答案,这是坏题。要出好题,必须先写一个解题器,每挖一格就验证一遍"仍然唯一解"。这个"生成器+解题器"的组合是真正的算法活:强模型一次做对,弱模型要么出坏题、要么干脆内置一个题库糊弄——而"连开 5 局看题目变不变"一秒就能戳穿它。

难度是真的,但天花板是封住的。 解题器是经典算法,不至于跑十几个小时。正好卡在"有趣有难度但不离谱"。

我给了目标就睡觉去了。原以为怎么也得两三个小时,结果不到两个小时,全做完了。早上起来微调了一下,上线,能玩。


六、监控看板

跑了一周,该回头看看账了。

本地把模型跑起来之后,很快冒出一个云端时代从没想过的问题:我到底用了多少?调云 API 时,账单页面告诉我花了多少钱、每个 key 消耗多少 Token;但模型跑在自己家里,这些又是一个黑盒——服务在跑,账没人记。

我去 GitHub 上转了一圈,重的太重,轻的又不对口。想明白之后发现,我要的不只是一个 Token 记录,而是一套本地管理的监控——哪些设备接入了、各自消耗多少、机器的运行状态怎么样、温度和功耗是否合理,这些都应该一目了然,方便未来做改进和优化。

最后写了一个两百行的透传代理,架在模型前面,每一笔经过的调用都记下时间、客户端、输入输出 Token,顺手给 GPU 拍一张温度和功耗的快照,全部落进一个 SQLite 文件。

后台凑成一个统计页:Token 消耗的时间曲线,悬停展开每一小时的输入与输出明细;一张使用时段热力图,把我几点在用、周几用得最凶照得清清楚楚;还有按客户端分解——谁是 Mac、谁是手机、哪个 Agent 在吃量,一目了然。因为机器经常开关机,图表专门做了断档处理:关机的时段曲线自然断开,不造假数据。

机器会自己记账了,而我,终于知道自己在怎么用它了。


七、回望

综上就是我这一周断断续续测试的内容。这篇文章确实有点长,虽然可以拆成两三篇来发,但说到底也不是什么教程,就是分享一下我拿本地模型配 DeepSeek Harness 跑了一周的成果,供大家参考。感兴趣的话,欢迎去我的主页点对应工具来体验,还是蛮好玩的。

通过这些测试,我对自己的 Token 消耗终于有了一些实际的认知。年初刚有 DeepSeek 的时候,花个两三千万就感觉已经很逆天了,不知道要忙些什么。现在呢?这两天本地有记录的消耗将近3 亿,加上之前没记录的部分和云端 Token Plan 的订阅,近 30 天总共消耗了 30 亿出头。感觉已经很省着用了,日均也跑到了 1 亿的量。

不禁有点唏嘘。也不知道是 Agent 的消耗开大了,还是我个人的需求变多了。

这笔账算下来,不知道能不能算一个成长。 但至少从"不知道拿它干什么"到"根本停不下来",这条路是实实在在走过来的。


哞小哞的杂货铺 · 2026 · 016