AI 论文里那些看不懂的词

先给结论: 读懂 AI 论文不需要智商,只需要知道大约三十个词在说什么。这一篇把它们全部解决掉——它是整个系列的地基页,任何时候读不懂某个词,回到这里查。

用法建议:不用背。先扫一遍有个印象,然后去读后面的文章,遇到卡住的地方再回来查。

一、模型本身:它是什么,有多大

术语地图:先归类,再理解模型长什么样参数层注意力专家词表怎么训练出来预训练微调强化学习奖励消融怎么用起来词元上下文KV cache推理延迟怎么衡量好坏基准准确率口径基线消融缺失同一个中文词可能在两层里意思不同——「推理」既是「模型运行」也是「解题能力」

把术语按「结构 / 训练 / 运行 / 评测」四层归类,位置感比死记更重要

大模型 / LLM:用海量文字训练出来的程序,核心功能是"根据前面的内容,预测下一个词"。它的"知识"来自训练,而不是查数据库。

参数(权重):模型内部的可调数字,相当于它的"脑细胞连接强度"。训练就是不断调整这些数字。

7B 表示 70 亿个参数,671B 表示 6710 亿个。这是数量,不是能力评分。

总参数 vs 激活参数:有些模型每次只动用一部分参数(见"混合专家")。总参数是全部家当,激活参数是每次实际动用的那一小部分。

看到"1.6T 总参数、49B 激活",意思是家当很大,但每次只用其中约 3%。

Transformer:2017 年提出、目前几乎所有大模型都在用的基础架构。它由许多层叠起来,每层主要做两件事:注意力 + 前馈网络。

Decoder(解码器):只往后看、一个字一个字往外写的结构。现在的主流大模型基本都是解码器。

嵌入(embedding):把文字变成一串数字的过程或结果。模型不认识字,只认识数字。

可以想象成给每个词一个坐标,“猫"和"狗"的坐标距离比较近。

注意力(attention):模型处理一个词时,回头看看前面哪些词跟自己有关,并按相关程度加权。

比喻:查字典时,每个字都互相瞟一眼,看谁该影响谁。

Q / K / V:注意力里的三个角色。Q 是"我在找什么”,K 是"我能提供什么",V 是"我实际的内容"。模型用 Q 和 K 算相关度,再按相关度取出 V。

KV cache(键值缓存):模型读长文章时,把算过的内容存下来避免重算,就是它的"读书笔记"。

这份笔记会随文章变长线性增长,是长文本处理最贵的地方——系列第九篇专讲这个。

MLA:DeepSeek 提出的一种省笔记的技术,把笔记压缩后再存。2026 年的新旗舰改用了别的方法。

FFN(前馈网络):注意力之后的那一层,做逐字的"思考"。混合专家技术主要替换的就是它。

归一化 / RMSNorm:训练时防止数字变得过大或过小的调节装置,类似音量自动平衡。

位置编码 / RoPE:让模型知道谁在前谁在后的机制,通过"旋转"数字来实现。

二、训练:模型是怎么学会的

预训练:让模型读海量文字、学习"下一个词是什么"的第一阶段。最烧钱,也决定了底子。

上下文窗口:模型一次能"看到"多少内容。128K 表示约 13 万个词元(这里 1K 按 1024 算)。

注意:窗口大不等于能有效利用,这是两件事。

微调 / SFT:预训练之后,用"问答范例"教模型按人类想要的方式回答。是从"会接话"变成"会听指令"。

强化学习(RL):不直接告诉模型正确答案,而是给它的输出打分,让它自己往高分方向调整。

奖励(reward):给模型输出的分数。可以来自规则(答案对不对),也可以来自另一个模型。

GRPO:DeepSeek 用过的一种强化学习方法。特点是不需要单独训练一个"预估分数"的助理网络(其他方法需要一个),而是让模型对同一个问题写多个答案,直接用这组答案的平均水平当基准来比较。

比喻:不请助教估分,让同一个学生写五遍,比一比哪遍更好,就往那个方向练。

思维链(CoT):让模型把推理步骤写出来,而不是直接给答案。写步骤往往能提高正确率。

蒸馏:把一个大模型的能力"教"给一个小模型,让小模型用更少的资源做类似的事。

灾难性遗忘:模型学新东西时把旧本事忘了。这是强化学习阶段要小心的问题。

三、效率:怎么省钱(本系列最多的内容)

稠密模型:每个字都要经过全部参数计算。稳但贵。

混合专家(MoE):把一个大网络拆成很多"专家",每次只叫几个相关的来干活。

比喻:大厨一个人做所有菜很慢,改成专家团分诊,每道菜只叫对应的人。

路由(routing):决定"这道题该叫哪几位专家"的机制。

负载均衡:防止所有任务都挤给同几位专家。有的专家累死,有的闲着,整体效率就下降。

稀疏 / 稀疏注意力:只处理一部分,而不是全部。

长文章里,“每个字都看全部字"代价是长度的平方——稀疏化的目标是打破这个平方。

量化:用更少的位数存数字。常见精度从高到低:FP32(32 位)、FP16/BF16(16 位)、FP8(8 位)、FP4(4 位)——位数越少越省内存和带宽,但数字越粗糙。

比喻:本来用精确到分的账本,改成精确到元——省空间,但对算法的要求更高。DeepSeek 从用 FP8 训练,到 2026 年用 FP4 处理专家参数。

FLOPs:计算量的单位,可以理解成"要做多少次基本运算”。

吞吐 / 延迟:吞吐是单位时间能处理多少,延迟是单个请求要等多久。两者常常此消彼长。

投机解码:先用便宜的小模型猜几个词,再让大模型快速核对,猜对了就省时间。

MTP(多词元预测):一次预测多个后续词,而不是只预测下一个,用于加速训练和推理。

四、评测与判断:数字怎么看

基准测试(benchmark):一套标准化考题,比如数学题库、代码题、阅读理解。

消融实验(ablation):一次只去掉一个设计,看效果掉多少,用来证明"这个设计确实有用"。没有消融实验的结论要打问号。

困惑度(PPL):衡量模型对文字的"意外程度"。越低说明越能预料下一个词。

但不同分词方式的困惑度不能直接比较——系列最后一篇会讲这类坑。

幻觉:模型一本正经地编造不存在的事实。根因是它在"预测像样的下一个词",而不是在"查证事实"。

多模态:能处理文字之外的内容(图片、音频)。让模型"看图说话"。

Agent / 智能体:不只是回答问题,而是能调用工具、多步执行任务的 AI 系统。

Harness:包在模型外面的工程框架,负责工具调用、权限、文件操作等。模型负责生成文字,Harness 负责把事做成。

五、两个中文里同名、必须分清的词

推理(reasoning):模型"思考"的过程——推导、分析、一步步解题。比如"这道数学题该怎么算"。

推理(inference):模型"运行"的过程——把输入算成输出。比如"部署一次推理要多少显存"。

中文都叫"推理",英文却是两个完全不同的词。读到"推理成本"指的是第二个,“推理能力"通常指第一个。 搞混会完全读错论文。


一句话总结: 上面这些词覆盖了本系列 95% 的阅读障碍,剩下的可以在正文里现场解释。

记住这个方法: 遇到不懂的词,先问"它是模型的一部分,还是训练的方法,还是一个衡量的数字”——归类之后,理解会快很多。

下一篇: 大模型到底在干什么——从头建一个最小心智模型。