DeepSeek 论文课(一):为什么值得花时间读 DeepSeek 的论文
四个阶段、三条主线,用 31 篇可核验的论文看懂 DeepSeek『用更少算力做同样的事』的研究路线,以及它为什么敢公开自己的不足。
15 篇文章,一条主线:用更少的计算,做到一样甚至更好。
每篇都配一张流程图或状态图,数字全部来自论文原文的逐篇核验。
四个阶段、三条主线,用 31 篇可核验的论文看懂 DeepSeek『用更少算力做同样的事』的研究路线,以及它为什么敢公开自己的不足。
把 AI 论文里最常见、也最容易望文生义的术语,按『模型长什么样、怎么训练、怎么用、怎么衡量』四层归好类,每个都说明它真正的含义。
大模型的『猜下一个词』到底在猜什么?为什么它一个字一个字往外吐,以及训练和使用为什么是两笔不同的账。
注意力机制的三步(打分、归一、加权)讲清楚,再看 DeepSeek 如何把『读书笔记』从每头 64 份压到 8 份共用。
参数量、数据量、算力三个『大小』如何互相制约;为什么算力固定时模型变大数据就得变少,以及每个词元的开销怎么算。
IsoFLOP 方法:先用 8 档小预算摸规律再外推,得到『模型乘 3.344、数据乘 2.990』——以及这些指数为什么换数据集就不适用。
专家模型怎么做到总参数 671B、每次只用 37B?门控、共享专家、top-k 选择与负载均衡,以及无辅助损失方案的取舍。
GRPO 为什么能省掉『估分助教』:同一道题写一组答案互相比,按组内归一化算优势;一组全对或全错时又会发生什么。
KV 压缩四代路线:MLA 存摘要、DSA 只挑相关、CSA/HCA 先压缩再挑、V4.1 跨层只留 4 层——两笔账必须分开算。
V4 一次换掉三样地基:MLA 被整个放弃换成 CSA+HCA、优化器换成 Muon、专家改用 FP4——以及『MLA 全文出现 0 次』意味着什么。
图像和文字怎么进同一个模型:切块、576 个视觉词元,以及『把文字印成图片反而更省』这条反直觉路线,加上压缩比的陷阱。
六道检查法:拿到任何数字先问前提、查均值加权、复算算术、扫跨节一致性、看数据卫生、确认归属版本。
557.6 万美元怎么算出来的、又为什么不等于『训练成本』:2,788K 卡时分项相加、通信藏进计算,以及被排除在外的部分。
把一部分知识『查出来』而不是『算出来』:哈希查表、门控融合、5.79B 记忆参数不到 3% 开销——它提速但不解决多步推理。
投机解码为什么无损、1+p 怎么算、DSpark 的两个改进,以及 60%–85% 提升的口径边界。