旗舰换代:V4 和 V4.1 一次改了什么
先给结论: 2026 年 4 月的 V4 报告,一口气换掉了三样用了很久的老零件——注意力的做法、训练时的修正规则、数字的精度。三样一起换,这才是"换代"的含义。而 2026 年 9 月的 V4.1,是在同一条路上继续往前推,不是第二次换代。
这是本系列第一次遇到一次动三处地基的论文,所以慢慢读。
一、V4 换的第一样:用了两年的注意力方案被整个放弃
三处地基同时替换:注意力、优化器、数值精度
先回忆第九篇讲过的事:模型读长文章时会给每个字做"读书笔记"(正式叫 KV cache);文章越长,笔记越多,越贵。老办法叫 MLA——把每条笔记压窄(特征维压缩),同样的内容用更少的数字记。
V4 把 MLA 整个不用了。论文全文零次出现 “MLA” 这个词,也零次出现 “latent attention”——不是改进,是弃用。
新方案是两套机制配合,叫 CSA 和 HCA(合称混合稀疏注意力):
- CSA(压缩稀疏注意力):把相邻的 4 个位置的笔记先按权重合并成 1 条,再去挑选。合并让"要被翻看的笔记数量"直接变成四分之一。
- HCA(重度压缩注意力):压缩得更狠——128 个位置合成 1 条,但因为条数少,它干脆全部看一遍,不做挑选。
打个比方:CSA 像把每 4 页装订成一页摘要,再挑最相关的几十页精读;HCA 像把每 128 页压成一张缩略图,然后每张都扫一眼,保证不漏角落。CSA 管"远距离精确取件",HCA 管"全网覆盖兜底"。
两套机制是一层换一层交替布置的——前半段用 HCA 起手,之后 CSA 和 HCA 轮流。也就是说,“这一层用什么注意力"从一个全局设置,变成了逐层的配置。这也正是 KV cache 的管理程序被迫重写的原因。
别把两个压缩方向混了: 这里压的是笔记条数(序列维),MLA 压的是每条笔记的宽度(特征维)。
二、V4 换的第二样:优化器从 AdamW 换成 Muon
优化器是什么?模型每次答错,往哪个方向、迈多大步子修正,这套规则就是优化器。它不改变结构,却直接决定训练能不能顺利走完。
V4 之前一直用 AdamW(业界默认)。V4 改用 Muon,做法是把每一步的修正方向**“摆正”**:先把动量整理成一个矩阵,再用一套叫 Newton-Schulz 的迭代法反复逼近,把它变成一个"各方向平等"的更新方向。
这套迭代到底跑几轮,必须回源确认——这是本篇最容易写错的地方之一。 V4 的配方是一共 10 步,分两段:
| 段 | 步数 | 多项式系数 | 这一步在干什么 |
|---|---|---|---|
| 第一阶段 | 8 步 | 3.4445、−4.7750、2.0315 | 快速把奇异值驱近 1(粗调) |
| 第二阶段 | 2 步 | 2、−1.5、0.5 | 该多项式在 1 处是二重根,残差按平方收缩(二次收敛),把奇异值精确稳住在 1(精调) |
一段粗调、一段精调,合起来 10 步。这是论文自述的改进,不是照抄外部版本。
Muon 也不全接管:嵌入表、预测头、mHC 的静态偏置与门控因子、全部 RMSNorm 仍留给 AdamW——那些不是矩阵形参数,“摆正方向"没有对应物。
三、V4 换的第三样:专家参数改用 4 位精度存,这对算法要求更高
模型内部每个数字都要用二进制存。位数越少,占的空间越小,但表达越粗糙。
- V3 走的是 FP8(8 位)。
- V4 的路由专家(可以理解成"专家团"里的专家,注意专家团机制见第七篇)改用 FP4(4 位)——比 FP8 再省一半。
打个比方:原来的账本精确到分,现在改成精确到元。账本薄了一半,但每一笔都变粗了。
关键在这里:这不是"换个存储格式"那么简单,它对训练方法本身提出了更高要求。 因为一个从没在粗糙账本上记过账的人,突然改用元为单位,会记错;模型也一样。所以必须在训练阶段就模拟这种粗糙感(术语叫量化感知训练),让模型一边学、一边适应低精度的误差,而不是训完了才硬压。论文里这套做法只施加在专家权重和索引器的打分路径上,训练主精度仍然是 FP8。
低精度还有一层口径:V4.1 论文给了三种精度的相对开销比——加权后 BF16 / FP8 / FP4 是 1 / 0.5 / 0.25,这只是相对大小,不是绝对时间。
四、规模数字必须连前提一起记
以下是 V4 两档的官方规格,每一行都带条件——数字脱离前提就不能用。
| 项目 | V4-Pro | V4-Flash | 前提说明 |
|---|---|---|---|
| 总参数 | 约 1.6T(1.6 万亿) | 284B(2840 亿) | 含专家团全部专家;不等于每次都用 |
| 每词元激活 | 约 49B | 13B | 每个词只叫醒一部分专家 |
| 预训练数据 | 33T 词元 | 32T 词元 | 论文摘要统称"超过 32T”,分档数字在正文 |
| 上下文 | 1M 词元 | 1M 词元 | 由 64K 基座用 YaRN 拉伸 16 倍得到 |
这里有一个特别容易被误读的数字:49B 比上一代 V3.2 的 37B 更多,不是更少。摘要原话专门强调了这一点——“即便 V4-Pro 的激活参数更多,也只花到 27%"。
所以"V4 效率更高"的原因不是"叫醒的人更少”,而是换了注意力做法、换了精度、把挑选范围缩得更小。 把 27% 说成"激活参数下降的结果”,与论文原话正好相反。
五、“27%“的真正秘密在分母:换个基线,它能变成 7%
论文给出的两个头条效率数字是:在 100 万词元上下文的单 token 推理里,V4-Pro 只用掉 DeepSeek-V3.2 的 27% 算力、10% 的笔记体积。
这句话里每一个字都是条件,缺一个都不能用:
- 比谁:比的是 V3.2——规格 671B/37B,且是已经用了稀疏挑选的那一版,不是"普通模型”,也不是 V3 的稠密版。
- 多长:100 万词元的单 token 生成成本。而 V3.2 的原生窗口只有 128K,它在 100 万处的数值是外推估计(来自论文图 1 右半,没有配套数据表)。
- 算力怎么记:以”等价 FP8 运算量“计,包含注意力打分、全部投影和专家激活。
- 笔记怎么记:指全模型累计的缓存体积(字节),不是条数、不是单层。
这是本篇最重要的现场教学。这个 27% 的分母里最大的一块,是"索引器"的开销——“给每个位置打分、决定该看哪里"的成本。在 100 万上下文时,它占了 V3.2 单 token 算力的 93%。
DeepSeek 自己的复算账本来是这样:
| 项目(100 万上下文) | V3.2 | V4-Pro |
|---|---|---|
| 索引器打分(最大项) | 1.048T | 0.129T(因为被打分的序列先压到 1/4) |
| 合计 | 1.124T | 0.296T → 26.4%(论文写 27%) |
但如果换错基线,结论会彻底变样: 假如不拿 V3.2 的稀疏版做分母,而拿 V3 时代的"稠密 MLA 版"口径(4.19T)去比,得到的比值会从 27% 掉到约 7%。
同一个模型、同一次推理,只因为分母换了,数字就从 27% 变成 7%——两个数字都能"算对”,但只有一个回答了论文真正要回答的问题。 这就是本系列从第二篇讲到第十二篇的那项元技能:看到百分比,先找分母。
六、V4 报告没说的那两件事(必须如实讲)
诚实是本系列的规矩,这一节不能省。V4 报告有几处明确缺失,我们照实记下,不粉饰:
- 没有消融实验。 所谓消融,就是把新设计一个个拆开、单独验证"到底哪一招有用”。V4 的 CSA/HCA(压缩率 4 和 128、top-k 1024/512)、Muon、mHC、FP4——全部只有配置陈述,没有任何一张对照实验表。也就是说,“这三样换掉之后各自贡献了多少”,论文没有回答。
- 没有训练成本。 上一代 V3 曾给出完整的显卡小时账(2.788M GPU 时),V4 全文既没有显卡小时,也没有美元成本,也没有训练效率指标。这类"花了多少钱"的信息,V4 收缩了。
- 头条数字来自估计曲线。 27%/10% 出自图 1 右半的估计曲线,没有配套数据表,论文也没给墙钟加速的数字。
- 数据配比、强化学习超参同样没有披露,论文自述"沿用 V3 的做法省略部分技术细节"。
这不是挑刺,而是"知道证据边界到哪儿"。 一家公司愿意把缺口留在那里,比一份处处完美的通稿更值得信任。
七、V4.1(2026 年 9 月):同一条路往前推,不是第二次换代
2026 年 9 月 17 日,V4.1-Flash 的技术报告公开。它的定位从标题就能看出来——“推进 KV cache 压缩的极限”。核心增量有两条:
第一条:把"只让少数层存主笔记"做成正式机制。 V4.1 全模型 40 层里只有 4 层需要自己存主笔记,其余层直接复用这些层的笔记与挑选结果。它还做了两处简化:去掉了 CSA 里"相邻块重叠取数"和"绝对位置嵌入"的设计。论文原话是这两处改动同时简化了实现、提升了训练效率。
第二条:记忆结构与多模态一起进旗舰。 V4.1 把 Engram 记忆结构(一种按词串直接查表的"外部记忆",196B 参数)和视觉通路装进同一个旗舰,并自称是 DeepSeek 第一个从语言预训练第一天起就原生多模态的旗舰。注意这个措辞的边界——是"原生多模态的旗舰",不是"第一次做多模态";多模态这条线 2024 年就开始了。
它的 KV 数字是这几个,四个数字四个分母,不许互相套用:
| 说法 | 值 | 口径 |
|---|---|---|
| 每 token 常驻显存的全局笔记 | 890 字节 | 这是绝对值,不含滑窗部分 |
| 相对上一代 Flash 的全局笔记 | 约 1/4 | 同序列长度、比 V4-Flash |
| 持久化到硬盘的笔记 | 约 1/8 | 比 V4-Flash,含"滑窗笔记不再持久化"这一半 |
| 相对 2024 年 V1 的每 token 笔记 | 约 437 倍 | 分母是 V1,跨了四代 |
网络流传的"压缩 437 倍"没有算错,但它比的是 2024 年的 V1,属于代际累计成绩,不是这次发布的进步。把 437 倍和 1/4 并排写而不说分母,就是第五节点名的那种误导。
V4.1 同样没有任何消融实验(全文没有一张消融表),并且论文自认新架构带来"尚未完全刻画的鲁棒性边界",点名了两处风险:压缩挑选可能挑错、滑窗状态的近似重建可能退化。
八、论文原话比网络传言保守得多
这一节是本篇的第二个诚实教学点。先看三种流传很广的说法,再对照论文原文:
| 网络说法 | 论文原话(条件) | 差在哪 |
|---|---|---|
| “V4 全面打败 GPT-5” | 全文零次出现裸的 “GPT-5”,只有 GPT-5.2 与 GPT-5.4;表述是"相对 GPT-5.2 和 Gemini-3.0-Pro 更优",同时"略逊于 GPT-5.4 和 Gemini-3.1-Pro",并自评"大约落后前沿 3 到 6 个月" | “最先进"的定语被限定为”开源模型中";唯一"追平闭源"的断言只限 Codeforces 这一个任务(3206 对 3168) |
| “V4/V4.1 全面超越 V4-Pro” | V4.1 的 §6 自述只有"相当,部分任务更好" | 论文表里 V4.1 有明显反超的行(如 TB 4.0:31.2 对 12.4),也有反过来的行(GPQA 90.9 对 92.4) |
换句话说:官方新闻稿的措辞比论文表格更强,引用基准应该取论文表格。 更难得的是,V4 报告自己写了"落后前沿 3 到 6 个月"——很少有公司把差距写进论文。一份材料愿意暴露弱点时,它的其他数字才更值得信任。
一句话总结: V4 是 DeepSeek 第一次把"注意力怎么做、优化器怎么修、数字用几位存"三样地基同时换掉,换来 100 万上下文下 27% 的算力和 10% 的笔记;而那个 27% 换个分母就能变成 7%——数字本身不可信,口径才可信。
记住这个数字: 27%——V4-Pro 在 100 万词元上下文下单 token 算力相对 V3.2(稀疏版)的比例;分母里 93% 是索引器开销,换错基线就得到 7%。
下一篇: AI 怎么"看"图:从认图到读文档