旗舰换代:V4 和 V4.1 一次改了什么

先给结论: 2026 年 4 月的 V4 报告,一口气换掉了三样用了很久的老零件——注意力的做法、训练时的修正规则、数字的精度。三样一起换,这才是"换代"的含义。而 2026 年 9 月的 V4.1,是在同一条路上继续往前推,不是第二次换代。

这是本系列第一次遇到一次动三处地基的论文,所以慢慢读。

一、V4 换的第一样:用了两年的注意力方案被整个放弃

V4 一次换掉三样地基注意力MLA(不存原文存摘要)CSA / HCA(先压缩再挑)换成优化器AdamW(逐参数自适应)Muon(正交化,混合 10 步)换成精度FP8(主精度)FP4(仅路由专家与打分)换成MLA 在 V4 全文出现 0 次 —— 这是 V3 线以来最大的架构断裂

三处地基同时替换:注意力、优化器、数值精度

先回忆第九篇讲过的事:模型读长文章时会给每个字做"读书笔记"(正式叫 KV cache);文章越长,笔记越多,越贵。老办法叫 MLA——把每条笔记压窄(特征维压缩),同样的内容用更少的数字记。

V4 把 MLA 整个不用了。论文全文零次出现 “MLA” 这个词,也零次出现 “latent attention”——不是改进,是弃用。

新方案是两套机制配合,叫 CSA 和 HCA(合称混合稀疏注意力):

  • CSA(压缩稀疏注意力):把相邻的 4 个位置的笔记先按权重合并成 1 条,再去挑选。合并让"要被翻看的笔记数量"直接变成四分之一。
  • HCA(重度压缩注意力):压缩得更狠——128 个位置合成 1 条,但因为条数少,它干脆全部看一遍,不做挑选。

打个比方:CSA 像把每 4 页装订成一页摘要,再挑最相关的几十页精读;HCA 像把每 128 页压成一张缩略图,然后每张都扫一眼,保证不漏角落。CSA 管"远距离精确取件",HCA 管"全网覆盖兜底"。

两套机制是一层换一层交替布置的——前半段用 HCA 起手,之后 CSA 和 HCA 轮流。也就是说,“这一层用什么注意力"从一个全局设置,变成了逐层的配置。这也正是 KV cache 的管理程序被迫重写的原因。

别把两个压缩方向混了: 这里压的是笔记条数(序列维),MLA 压的是每条笔记的宽度(特征维)。

二、V4 换的第二样:优化器从 AdamW 换成 Muon

优化器是什么?模型每次答错,往哪个方向、迈多大步子修正,这套规则就是优化器。它不改变结构,却直接决定训练能不能顺利走完。

V4 之前一直用 AdamW(业界默认)。V4 改用 Muon,做法是把每一步的修正方向**“摆正”**:先把动量整理成一个矩阵,再用一套叫 Newton-Schulz 的迭代法反复逼近,把它变成一个"各方向平等"的更新方向。

这套迭代到底跑几轮,必须回源确认——这是本篇最容易写错的地方之一。 V4 的配方是一共 10 步,分两段:

段步数多项式系数这一步在干什么
第一阶段8 步3.4445、−4.7750、2.0315快速把奇异值驱近 1(粗调)
第二阶段2 步2、−1.5、0.5该多项式在 1 处是二重根,残差按平方收缩(二次收敛),把奇异值精确稳住在 1(精调)

一段粗调、一段精调,合起来 10 步。这是论文自述的改进,不是照抄外部版本。

Muon 也不全接管:嵌入表、预测头、mHC 的静态偏置与门控因子、全部 RMSNorm 仍留给 AdamW——那些不是矩阵形参数,“摆正方向"没有对应物。

三、V4 换的第三样:专家参数改用 4 位精度存,这对算法要求更高

模型内部每个数字都要用二进制存。位数越少,占的空间越小,但表达越粗糙。

  • V3 走的是 FP8(8 位)。
  • V4 的路由专家(可以理解成"专家团"里的专家,注意专家团机制见第七篇)改用 FP4(4 位)——比 FP8 再省一半。

打个比方:原来的账本精确到分,现在改成精确到元。账本薄了一半,但每一笔都变粗了。

关键在这里:这不是"换个存储格式"那么简单,它对训练方法本身提出了更高要求。 因为一个从没在粗糙账本上记过账的人,突然改用元为单位,会记错;模型也一样。所以必须在训练阶段就模拟这种粗糙感(术语叫量化感知训练),让模型一边学、一边适应低精度的误差,而不是训完了才硬压。论文里这套做法只施加在专家权重和索引器的打分路径上,训练主精度仍然是 FP8。

低精度还有一层口径:V4.1 论文给了三种精度的相对开销比——加权后 BF16 / FP8 / FP4 是 1 / 0.5 / 0.25,这只是相对大小,不是绝对时间。

四、规模数字必须连前提一起记

以下是 V4 两档的官方规格,每一行都带条件——数字脱离前提就不能用。

项目V4-ProV4-Flash前提说明
总参数约 1.6T(1.6 万亿)284B(2840 亿)含专家团全部专家;不等于每次都用
每词元激活约 49B13B每个词只叫醒一部分专家
预训练数据33T 词元32T 词元论文摘要统称"超过 32T”,分档数字在正文
上下文1M 词元1M 词元由 64K 基座用 YaRN 拉伸 16 倍得到

这里有一个特别容易被误读的数字:49B 比上一代 V3.2 的 37B 更多,不是更少。摘要原话专门强调了这一点——“即便 V4-Pro 的激活参数更多,也只花到 27%"。

所以"V4 效率更高"的原因不是"叫醒的人更少”,而是换了注意力做法、换了精度、把挑选范围缩得更小。 把 27% 说成"激活参数下降的结果”,与论文原话正好相反。

五、“27%“的真正秘密在分母:换个基线,它能变成 7%

论文给出的两个头条效率数字是:在 100 万词元上下文的单 token 推理里,V4-Pro 只用掉 DeepSeek-V3.2 的 27% 算力、10% 的笔记体积。

这句话里每一个字都是条件,缺一个都不能用:

  1. 比谁:比的是 V3.2——规格 671B/37B,且是已经用了稀疏挑选的那一版,不是"普通模型”,也不是 V3 的稠密版。
  2. 多长:100 万词元的单 token 生成成本。而 V3.2 的原生窗口只有 128K,它在 100 万处的数值是外推估计(来自论文图 1 右半,没有配套数据表)。
  3. 算力怎么记:以”等价 FP8 运算量“计,包含注意力打分、全部投影和专家激活。
  4. 笔记怎么记:指全模型累计的缓存体积(字节),不是条数、不是单层。

这是本篇最重要的现场教学。这个 27% 的分母里最大的一块,是"索引器"的开销——“给每个位置打分、决定该看哪里"的成本。在 100 万上下文时,它占了 V3.2 单 token 算力的 93%。

DeepSeek 自己的复算账本来是这样:

项目(100 万上下文)V3.2V4-Pro
索引器打分(最大项)1.048T0.129T(因为被打分的序列先压到 1/4)
合计1.124T0.296T → 26.4%(论文写 27%)

但如果换错基线,结论会彻底变样: 假如不拿 V3.2 的稀疏版做分母,而拿 V3 时代的"稠密 MLA 版"口径(4.19T)去比,得到的比值会从 27% 掉到约 7%。

同一个模型、同一次推理,只因为分母换了,数字就从 27% 变成 7%——两个数字都能"算对”,但只有一个回答了论文真正要回答的问题。 这就是本系列从第二篇讲到第十二篇的那项元技能:看到百分比,先找分母。

六、V4 报告没说的那两件事(必须如实讲)

诚实是本系列的规矩,这一节不能省。V4 报告有几处明确缺失,我们照实记下,不粉饰:

  • 没有消融实验。 所谓消融,就是把新设计一个个拆开、单独验证"到底哪一招有用”。V4 的 CSA/HCA(压缩率 4 和 128、top-k 1024/512)、Muon、mHC、FP4——全部只有配置陈述,没有任何一张对照实验表。也就是说,“这三样换掉之后各自贡献了多少”,论文没有回答。
  • 没有训练成本。 上一代 V3 曾给出完整的显卡小时账(2.788M GPU 时),V4 全文既没有显卡小时,也没有美元成本,也没有训练效率指标。这类"花了多少钱"的信息,V4 收缩了。
  • 头条数字来自估计曲线。 27%/10% 出自图 1 右半的估计曲线,没有配套数据表,论文也没给墙钟加速的数字。
  • 数据配比、强化学习超参同样没有披露,论文自述"沿用 V3 的做法省略部分技术细节"。

这不是挑刺,而是"知道证据边界到哪儿"。 一家公司愿意把缺口留在那里,比一份处处完美的通稿更值得信任。

七、V4.1(2026 年 9 月):同一条路往前推,不是第二次换代

2026 年 9 月 17 日,V4.1-Flash 的技术报告公开。它的定位从标题就能看出来——“推进 KV cache 压缩的极限”。核心增量有两条:

第一条:把"只让少数层存主笔记"做成正式机制。 V4.1 全模型 40 层里只有 4 层需要自己存主笔记,其余层直接复用这些层的笔记与挑选结果。它还做了两处简化:去掉了 CSA 里"相邻块重叠取数"和"绝对位置嵌入"的设计。论文原话是这两处改动同时简化了实现、提升了训练效率。

第二条:记忆结构与多模态一起进旗舰。 V4.1 把 Engram 记忆结构(一种按词串直接查表的"外部记忆",196B 参数)和视觉通路装进同一个旗舰,并自称是 DeepSeek 第一个从语言预训练第一天起就原生多模态的旗舰。注意这个措辞的边界——是"原生多模态的旗舰",不是"第一次做多模态";多模态这条线 2024 年就开始了。

它的 KV 数字是这几个,四个数字四个分母,不许互相套用:

说法值口径
每 token 常驻显存的全局笔记890 字节这是绝对值,不含滑窗部分
相对上一代 Flash 的全局笔记约 1/4同序列长度、比 V4-Flash
持久化到硬盘的笔记约 1/8比 V4-Flash,含"滑窗笔记不再持久化"这一半
相对 2024 年 V1 的每 token 笔记约 437 倍分母是 V1,跨了四代

网络流传的"压缩 437 倍"没有算错,但它比的是 2024 年的 V1,属于代际累计成绩,不是这次发布的进步。把 437 倍和 1/4 并排写而不说分母,就是第五节点名的那种误导。

V4.1 同样没有任何消融实验(全文没有一张消融表),并且论文自认新架构带来"尚未完全刻画的鲁棒性边界",点名了两处风险:压缩挑选可能挑错、滑窗状态的近似重建可能退化。

八、论文原话比网络传言保守得多

这一节是本篇的第二个诚实教学点。先看三种流传很广的说法,再对照论文原文:

网络说法论文原话(条件)差在哪
“V4 全面打败 GPT-5”全文零次出现裸的 “GPT-5”,只有 GPT-5.2 与 GPT-5.4;表述是"相对 GPT-5.2 和 Gemini-3.0-Pro 更优",同时"略逊于 GPT-5.4 和 Gemini-3.1-Pro",并自评"大约落后前沿 3 到 6 个月"“最先进"的定语被限定为”开源模型中";唯一"追平闭源"的断言只限 Codeforces 这一个任务(3206 对 3168)
“V4/V4.1 全面超越 V4-Pro”V4.1 的 §6 自述只有"相当,部分任务更好"论文表里 V4.1 有明显反超的行(如 TB 4.0:31.2 对 12.4),也有反过来的行(GPQA 90.9 对 92.4)

换句话说:官方新闻稿的措辞比论文表格更强,引用基准应该取论文表格。 更难得的是,V4 报告自己写了"落后前沿 3 到 6 个月"——很少有公司把差距写进论文。一份材料愿意暴露弱点时,它的其他数字才更值得信任。


一句话总结: V4 是 DeepSeek 第一次把"注意力怎么做、优化器怎么修、数字用几位存"三样地基同时换掉,换来 100 万上下文下 27% 的算力和 10% 的笔记;而那个 27% 换个分母就能变成 7%——数字本身不可信,口径才可信。

记住这个数字: 27%——V4-Pro 在 100 万词元上下文下单 token 算力相对 V3.2(稀疏版)的比例;分母里 93% 是索引器开销,换错基线就得到 7%。

下一篇: AI 怎么"看"图:从认图到读文档