<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>DeepSeek on zo0043</title><link>http://blog.zero43.top/categories/deepseek/</link><description>Recent content in DeepSeek on zo0043</description><image><title>zo0043</title><url>https://i.postimg.cc/7hwBy7VS/calcr.png</url><link>https://i.postimg.cc/7hwBy7VS/calcr.png</link></image><generator>Hugo -- 0.130.0</generator><language>zh</language><copyright>©2024 zo0043</copyright><lastBuildDate>Wed, 30 Sep 2026 16:54:00 +0800</lastBuildDate><atom:link href="http://blog.zero43.top/categories/deepseek/index.xml" rel="self" type="application/rss+xml"/><item><title>DeepSeek 论文课（十五）：让模型说话更快：投机解码与 DSpark</title><link>http://blog.zero43.top/posts/deepseek-paper-course-15-dspark/</link><pubDate>Wed, 30 Sep 2026 16:54:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-15-dspark/</guid><description>让模型说话更快：投机解码与 DSpark 先给结论： 模型回答时是一个词一个词往外吐的，每个词都要走一遍完整的大模型计算——这是推理慢的根本原因。DSpar</description></item><item><title>DeepSeek 论文课（十四）：让模型"查表"记住知识：Engram 记忆</title><link>http://blog.zero43.top/posts/deepseek-paper-course-14-engram/</link><pubDate>Wed, 30 Sep 2026 16:52:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-14-engram/</guid><description>让模型&amp;quot;查表&amp;quot;记住知识：Engram 记忆 先给结论： 模型的知识一直存在参数里——要用就得&amp;quot;算出来&amp;quot;，很</description></item><item><title>DeepSeek 论文课（十三）：同样一万张卡，怎么花出两倍效果</title><link>http://blog.zero43.top/posts/deepseek-paper-course-13-systems-cost/</link><pubDate>Wed, 30 Sep 2026 16:50:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-13-systems-cost/</guid><description>同样一万张卡，怎么花出两倍效果 先给结论： 训练大模型最贵的东西不是&amp;quot;卡好不好&amp;quot;，而是每一块钱买到了多少有效计算。DeepS</description></item><item><title>DeepSeek 论文课（十二）：论文里的数字怎么看才不被骗</title><link>http://blog.zero43.top/posts/deepseek-paper-course-12-numbers/</link><pubDate>Wed, 30 Sep 2026 16:48:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-12-numbers/</guid><description>论文里的数字怎么看才不被骗 先给结论： 读论文最难的一关，从来不是看懂机制，而是看懂数字。同一篇报告，媒体标题可以写成&amp;quot;全面击败最强对</description></item><item><title>DeepSeek 论文课（十一）：AI 怎么"看"图：从认图到读文档</title><link>http://blog.zero43.top/posts/deepseek-paper-course-11-multimodal/</link><pubDate>Wed, 30 Sep 2026 16:46:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-11-multimodal/</guid><description>AI 怎么&amp;quot;看&amp;quot;图：从认图到读文档 先给结论： 多模态就是让同一个模型同时处理文字和图片，而这条线十几年的工程史其实只在回答两个</description></item><item><title>DeepSeek 论文课（十）：旗舰换代：V4 和 V4.1 一次改了什么</title><link>http://blog.zero43.top/posts/deepseek-paper-course-10-v4/</link><pubDate>Wed, 30 Sep 2026 16:44:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-10-v4/</guid><description>旗舰换代：V4 和 V4.1 一次改了什么 先给结论： 2026 年 4 月的 V4 报告，一口气换掉了三样用了很久的老零件——注意力的做法、训练时的修正规则、数字的精度。三</description></item><item><title>DeepSeek 论文课（九）：长文本为什么贵：KV 压缩的四代路线之争</title><link>http://blog.zero43.top/posts/deepseek-paper-course-09-kv-compression/</link><pubDate>Wed, 30 Sep 2026 16:42:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-09-kv-compression/</guid><description>长文本为什么贵：KV 压缩的四代路线之争 先给结论： 模型读长文章要花的钱有两笔——一笔随文章变长一份一份往上加（KV cache），一笔随文章变长</description></item><item><title>DeepSeek 论文课（八）：模型怎么会"想"了：GRPO 与 R1</title><link>http://blog.zero43.top/posts/deepseek-paper-course-08-rl-reasoning/</link><pubDate>Wed, 30 Sep 2026 16:40:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-08-rl-reasoning/</guid><description>模型怎么会&amp;quot;想&amp;quot;了：GRPO 与 R1 先给结论： 上一篇讲&amp;quot;结构省钱&amp;quot;，这一篇转向训练方法。模型的&amp;quot</description></item><item><title>DeepSeek 论文课（七）：省钱第一招：把一个大厨换成专家团</title><link>http://blog.zero43.top/posts/deepseek-paper-course-07-moe/</link><pubDate>Wed, 30 Sep 2026 16:38:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-07-moe/</guid><description>省钱第一招：把一个大厨换成专家团 先给结论： 要想模型更强，最直觉的办法是把它做大；但做大之后，你为每一个字都要付全部代价。DeepSeek 省钱</description></item><item><title>DeepSeek 论文课（六）：第一步不是造模型，是算该花多少钱</title><link>http://blog.zero43.top/posts/deepseek-paper-course-06-scaling/</link><pubDate>Wed, 30 Sep 2026 16:36:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-06-scaling/</guid><description>第一步不是造模型，是算该花多少钱 先给结论： DeepSeek 的第一篇论文没去抢&amp;quot;最大模型&amp;quot;的名头，而是先用小实验把&amp;quot;参数、数据</description></item><item><title>DeepSeek 论文课（五）：参数、数据、算力：三个"大小"千万别混</title><link>http://blog.zero43.top/posts/deepseek-paper-course-05-three-sizes/</link><pubDate>Wed, 30 Sep 2026 16:34:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-05-three-sizes/</guid><description>参数、数据、算力：三个&amp;quot;大小&amp;quot;千万别混 先给结论： 论文里的&amp;quot;大&amp;quot;至少有三种完全不同的单位——参数量数的</description></item><item><title>DeepSeek 论文课（四）：注意力：模型怎么"看"上下文</title><link>http://blog.zero43.top/posts/deepseek-paper-course-04-attention/</link><pubDate>Wed, 30 Sep 2026 16:32:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-04-attention/</guid><description>注意力：模型怎么&amp;quot;看&amp;quot;上下文 先给结论： 模型猜下一个词时，靠的是让前文里每个词互相&amp;quot;看一眼&amp;quot;，再按相关</description></item><item><title>DeepSeek 论文课（三）：大模型到底在干什么</title><link>http://blog.zero43.top/posts/deepseek-paper-course-03-how-llm-works/</link><pubDate>Wed, 30 Sep 2026 16:30:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-03-how-llm-works/</guid><description>大模型到底在干什么 先给结论： 大模型做的事情只有一件——根据前面的内容，猜下一个词。所有看起来神奇的&amp;quot;能力&amp;quot;，都是从这一件</description></item><item><title>DeepSeek 论文课（二）：AI 论文里那些看不懂的词</title><link>http://blog.zero43.top/posts/deepseek-paper-course-02-glossary/</link><pubDate>Wed, 30 Sep 2026 16:25:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-02-glossary/</guid><description>AI 论文里那些看不懂的词 先给结论： 读懂 AI 论文不需要智商，只需要知道大约三十个词在说什么。这一篇把它们全部解决掉——它是整个系列的地基页，任何时</description></item><item><title>DeepSeek 论文课（一）：为什么值得花时间读 DeepSeek 的论文</title><link>http://blog.zero43.top/posts/deepseek-paper-course-01-intro/</link><pubDate>Wed, 30 Sep 2026 16:20:00 +0800</pubDate><guid>http://blog.zero43.top/posts/deepseek-paper-course-01-intro/</guid><description>为什么值得花时间读 DeepSeek 的论文 先给结论： 因为 DeepSeek 的论文是公开资料里，少数能把&amp;quot;一个好主意&amp;quot;和&amp;quot;它到底花了多少钱&amp;qu</description></item></channel></rss>