DeepSeek 论文课

15 篇文章,一条主线:用更少的计算,做到一样甚至更好。
每篇都配一张流程图或状态图,数字全部来自论文原文的逐篇核验。

按你的兴趣挑入口

时间不多、先看结论: 为什么值得读 → 三个"大小" → KV 压缩 → 557.6 万美元
想知道模型内部怎么运作: 猜下一个词 → 注意力 → 专家模型 → 强化学习
只追最新一代技术: V4 换代 → 多模态 → Engram 记忆 → DSpark 加速
上一页列的 15 篇,数字全部来自 31 篇 DeepSeek 论文报告的逐篇核验, 每篇文末附「原文出处」与对应的 arXiv 版本号——你可以自己打开核对我算的数。 如果发现哪一处算错了,欢迎在评论区指出。