最近看到一个很有意思的热搜,那就是“DeepSeek Harness在Linux的极简模式疑似能让DSV4PRO水平大幅提高?”。 花了点时间深度挖掘了一下,还真的挖出来不少好东西。
如果你想要知道什么情况下Harness突然能力提升、以及Harness能力的真相,可以通过这篇文章发现全部内容。
先泼一盆冷水:这事跟 Linux 基本没关系。
Mac 能复现,Windows 能复现,WSL 也能复现。我甚至看到有人直接在 Windows 上跑出 98 和 99。所以你换成 Arch,也不会多考一分。
别纠结发行版了。真正起作用的,只有一个东西:首轮上下文的结构。
现象是真的,归因全错了
昨晚看到这条热榜,我第一反应不是兴奋,而是熟悉——这不就是我做 Agent 落地这一年来反复撞上的那个墙吗?
先摆数据。同一套真实工程维护任务,只换 harness 不换模型:
- V4 Pro 在 OpenCode、WorkBuddy 和官方 DSH 的标准模式、PTC 模式下,都只有 91~93 分;
- 切到极简模式,两次跑出 99 和 96,跟发布前灰测的成绩完全一致。
差距不是一点点,是肉眼可见的"降智"到"满血"的切换。
那极简模式到底给了什么?只保留 Bash 和文件编辑两件工具,其余能力全关,系统提示词短到只剩一句 "You are a helpful software engineer assistant"。
最邪门的是连口癖都跟着变。标准模式满屏 "Let me",极简模式下 "Let me" 基本消失,全是 "Let us" 和 "We need"。这个特征在灰度期被当成"官方偷偷切模型",现在看明白了:同一套权重,两种推理形态而已。
Image谜底就藏在谜面上
如果你以为我要吹"极简模式是神",那你也猜错了。
V4 Pro 正式发版前几天,Harness 仓库进了一条 commit,内容是把 Minimal Agent 与 RL 训练时使用的 Agent Composition 对齐。翻译成人话:官方跑分的考场,就是极简模式。
V4 Flash 的 API 文档里也白纸黑字写着,公开基准里的 Code Agent 任务,用的就是 DSH 极简模式。
所以这不是玄学,是模型在后训练阶段跟一个特定脚手架绑得太死。你把它从熟悉的考场挪出来,它就不太会做题了——它只是"认环境",不是"变聪明"。
有人做了个两阶段插件(dsh-anchored-standard):首轮只给 shell 和 read,把推理轨迹锚定到极简那条路上,第一次工具调用完成后,立刻恢复标准模式全部 25 项工具。
结果:Windows 连跑两次 98 和 99,均值 98.5,第二轮全程没出现 "Let me"。
这个实验一箭双雕,同时证伪了"Linux 有魔法"和"工具少所以题变简单"。工具还是那 25 个,只是第一轮没让模型看见。
问题出在首轮的 token 配比。
标准模式第一轮塞进 25 个工具的 schema,用户真正的诉求被稀释成一小撮 token。模型的算力被那堆繁琐 Schema 抢走,第一条推理轨迹一歪,后面全程跟着歪。
Image本质:这是一次"Harnes 过拟合",甚至可能是 Attention Sink
现在可以下结论了。极简模式的高分,指向一个更底层的机制——过拟合。
有位做数学方向的答主给出了一个很漂亮的理论解释:Transformer 里 Softmax 的归一化特性,强制所有 Token 的注意力权重求和等于 1。模型总会给第一个位置的 Token(哪怕只是个 <bos>)分配恐怖的注意力权重,作为"倾倒垃圾的集中垃圾站"。这就是 attention sink,也叫首个 Token 主导现象。
套到这事上:如果模型在后训练时习惯了和首轮提示词保持高度一致,甚至由首轮提示词完全指导后期行为,那它学习到的就不是"怎么做题",而是"怎么在某个固定的开头里做题"。
你可以叫它首轮提示词偏差,也可以叫它"Harness 过拟合"。
还有个佐证:V4 Flash 完全没有这个问题。Flash 在不同 Harness 下分数稳定在 90~95,切极简模式也没啥变化。所以这更像 V4 Pro 训练时对自家格式过拟合了——Harness 是 DeepSeek 的角色专武,实锤。
Image往后怎么走:Harness 的下一步
这个发现比单纯的"极简模式性能暴增"有价值得多。它揭示了一个更深的问题:
当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。
所以未来通用 Harness 的方向,不是堆更多工具,也不是砍工具,而是:
- 按模型调整初始提示词和初始工具集——各家模型的后训练环境不一样,首轮就该对齐各自熟悉的环境;
- 启动阶段对齐训练分布——先锚定轨迹,再释放完整能力(dsh-anchored-standard 已经证明这条路通);
- 从"给模型脚手架"转向"给模型自由"——模型越强,越该拆除多余的框。
这也是为什么我一直说,别把某个框架当神。真正值钱的,是搞清楚每个模型"什么时候最清醒"。
结语
回到开头那句话:极简模式能让 V4 Pro 满血,是真的;但把它归因给 Linux,是错的。
它是"角色专武"现象,是后训练过拟合的一次公开处刑,也是 Harness 行业的一次集体清醒。
最后留一个问题给大家吵:既然"首轮对齐 + 两阶段恢复"就能唤醒满血能力,那我们对 Harness 的想象,是不是该彻底翻篇了?评论区聊聊。