资讯

万字长文拆解DeepSeek V4 Pro与Harness:从后训练到「代理自进化」,更大的变化在开源框架里

雷峰网·2026/9/1 08:41:00🔗 原文

📌 概要

不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。(雷峰网) 从 1812 年黑格尔的辩证法,到马克思、列宁,再到 1915 年毛泽东在延安写下的《矛盾论》,一百多年里,这套思想最终落到了一个很实际的问题上: 复杂事物中矛盾很多,但真正重要的是找到决定其他矛盾的主要矛盾。 今天的大模型行业也不例外,当前大模型行业面临的主要问题

⚡ 关键要点

  • 不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个


不管哪个时代,人都会遇到同一道题:无论宏大叙事还是人生决策,面前问题太复杂,资源和时间却不够,必须决定先做哪个、放弃哪个。(雷峰网)

从 1812 年黑格尔的辩证法,到马克思、列宁,再到 1915 年毛泽东在延安写下的《矛盾论》,一百多年里,这套思想最终落到了一个很实际的问题上:复杂事物中矛盾很多,但真正重要的是找到决定其他矛盾的主要矛盾。

今天的大模型行业也不例外,当前大模型行业面临的主要问题有以下这些:

1.模型能力的增长速度,同把这种能力转化成可靠产出的能力之间的矛盾(模型强,但产出物没价值)

2.算力资源受限,同能力需求无限之间的矛盾(人们总吐槽 AI 太傻)。

3.单价在快速下降,同真实账单在上涨之间的矛盾(模型便宜了,但每个月花的更多了)。

4.要做通用智能,同要交付一个能用的产品之间矛盾(简单的不好用,好用的不简单)。

这些矛盾才构成了交错向上发展的行业和机会。没有人能逃避这些选项,DeepSeek 也一样。

我们对 deepseek-v4-Pro以及 Harness 做了几轮实测:直接打接口的探针、七次编码任务运行(其中四次是只改一个变量的对照)、把上下文压到 92 万 token 的位置测试,加上把它 19.8 万行源码和 21.7 万行测试过了一遍。试图来回答以下问题:

1.v4-Pro这个模型到底怎样,比 flash、preview 版本有哪些不同?

2.好多网友反馈接入其他 Harness 会降智是怎么回事?

3.使用成本到底怎么样?能否量化?

4.Harness 解决什么问题?什么人适合它?

总而言之,这几天的研究和使用下来还是很精彩的,我们甚至能透过 v4-Pro和 Harness 管中窥豹,看到一些 DeepSeek 对技术、对人性,甚至对世界的判断和认知。


01

先看模型:DeepSeek V4 Pro 到底强在哪里?

Pro 很可能重做了一次非常先进的后训练

Pro和 Flash 这两个模型其实有挺多版本,我们一次性拉出来看下:

【Provs Flash 全参数对照,含字段释义】

我们会发现两个有意思的结论:

1.Pro 对比 flash,模型本身的层面在深度、宽度、注意力、专家池以及专家内部宽度都有很大进展。

2.但这五个维度都是预训练阶段就定性的,不是后训练带来的变量。

(有一样是相同的:每个 token 实际只激活 6 个专家,两个模型都是 6。)

还有一处彩蛋,后面会再 call back:deepseek Harness 的出厂默认模型写的是 deepseek-v4-flash。

【packages/bundle/base/cordis.patch.yml 

里 agent-default-model 】

为什么 Pro 正式版拖到 Flash 转正之后才公布?坊间其实预测 Pro 早就该来了。

我们都知道模型预训练定天花板,后训练定发挥。如果去翻旧账会发现四月那版 v4-Pro-Preview 其实有一个缺陷:竞赛型代码题三项全场第一,但 Terminal Bench 2.0 只有 67.9。7 月 31 日 Flash 转正,官方贴出它的 Terminal Bench 2.1 是 82.7,而同一张表里 Pro-Preview 是 72.1也就是说 Flash 正式版的 Terminal Bench 已经比旗舰模型 Pro的分数高不少了,我合理推测 DeepSeek 在 Flash 版本上尝试出了更好的后训练方法,因此 v4-Pro 被回炉重造。

【官方自测当前 v4 家族和几款旗舰模型的评测分数】

再看 v4-pro-0813 的几项跃升里边,正好 Terminal Bench 2.1 从 72.1 到 87.9,DeepSWE 从 12.8 到 62.7,内部全栈测试集从 41.8 到 71.1

我自己也出了两道题去验这件事,因为分数涨了和活能不能干好是两回事。一道是同一个改动要落到五处分散的调用点上,其中一处是用字符串登记的,grep 根本搜不出来;另一道是两个前后串联的故障,修的顺序错了就白改。在实测中六次运行全部满分,那个搜不出来的点它也找到了。(我们自己造的题、样本小,不与官方或第三方的分数并列比较。)

也就是说这一版补上的是能自己把一件活干完的能力。以前估计得在旁边盯着,现在可以把一件有明确验收标准的活交出去,然后走开。(而且做的更好了。)

但这张官方表还有另一半,中英文媒体都没提。媒体的叙事是“逼近 Claude Fable 5”。而在 DeepSeek 自己贴的对照表里,Kimi K3 在多数 agentic 项上仍然领先 0813,比如 Terminal Bench 2.1 是 88.3 对 87.9,DeepSWE 67.5 对 62.7,Toolathlon 76.5 对 74.1,Agents' Last Exam 27.6 对 25.7。0813 只在三项上领先。(这是官方自测表,K3 与 GLM 的分数来源官方未说明。)

大概 deepseek 想传递的叙事是发生在国产开源之间,并无心和国外闭源模型较真。

还有一个更有意思的数据:官方 changelog 里 Flash-0731 和 Pro-0813 用的是同一套内部测试集、同一个 Harness,所以可以直接并排:

【Flash-0731 vs Pro-0813 同口径九项】

Pro 的总参是 Flash 的 5.6 倍、激活参数 3.8 倍。但换来的是个位数的领先最难那一项 Agents' Last Exam 分别是25.2 对 25.7,几乎打平。而且它自己那个框架的出厂默认模型写的是 deepseek-v4-flash;第三方评测机构 AA 的 coding agent 榜上,DeepSeek 那一行用的也是 Flash;两个老模型名下线前指向的同样是 Flash。

【AA 的 coding agent 榜上 DeepSeek 那行用的是 Codex+Flash】

几条独立线索都指向同一件事:Flash 才是它认定的主力性价比档,Pro 是上限档。

但是官方并没有披露过 0813 这个版本重做了后训练,只说它建立在 Preview 的结构之上、外挂了一个投机解码模块。但同系列的 Flash-0731 有明文:"keeps the same model architecture and size … and was only re-post-trained"。因此 Pro模型重新做过后训练是我们的单纯推断而已。

【Flash-0731 官方明文“只重做了后训练”】

还有个值得一提的行业现象,隔一天发布的 GLM-5.3也是同一个 744B 底座、不换架构、不重新预训练,全部提升来自延长后训练,也主打 agentic。两家头部开源模型隔一天做了同一个动作是否说明这一代旗舰升级的主战场,已经从预训练挪到了后训练。

1M 上下文的真相

这是本轮最独家的一处发现,而且任何人都能自己核对。

【Hugging Face 上 config.json 里的 rope_scaling 那几行】

65536 × 16 = 1,048,576,正好 1M。也就是说这 1M 不是原生训练出来的,是在 64K 的基础上用一种叫 YaRN 的办法外推 16 倍得到的。像一个只在 100 米跑道上练过的人,你让他跑 1600 米。 也不是不能跑,但是很可能最后几百米的质量直线下降。而且这在同行里是特殊的。三家都标 1M:

【三家 1M 的三条不同路径】

我们可以看到在三个都标 1M 的开源旗舰里,只有 DeepSeek 在配置里明确用了外推缩放。

Kimi K3 没有这个字段,它换掉了注意力机制本身;GLM-5.2 也没有外推参数,它把 rope_theta 拉到了 800 万。但必须说明配置只能证明是否在推理期做位置缩放,不能直接证明训练长度,所以准确说法是只有它明确用了外推。另外 GLM-5.3 的权重开源延后约两周,这一栏对照的是 5.2 的可核配置。

顺便一提:GLM-5.2 的架构类名叫 GlmMoeDsaForCausalLM,它的 indexer 字段和 DeepSeek V4 同名,index_head_dim 连值都一样是 128。而智谱在自己的官方模型卡里明写:"GLM-5 also integrates DeepSeek Sparse Attention (DSA