论文里的数字怎么看才不被骗
先给结论: 读论文最难的一关,从来不是看懂机制,而是看懂数字。同一篇报告,媒体标题可以写成"全面击败最强对手",论文原文写的却是"比前沿大约落后 3 到 6 个月"——两个说法用的是同一批数据,差别只在于谁删掉了前提。
这是系列收官篇,但它不总结某篇论文,而是教你一件"元技能":拿到一个数字,怎么在两分钟内判断它值不值得信。 下面六道检查加四个子检查,每条都配一个真实论文里的案例。
一、数字不是事实,而是"带条件的一句话"
六道检查:每一个数字在被引用前都要过一遍
论文里的数字很少是"客观读数",它更像一句被压缩过的话,里面藏着三个空:
- 跟谁比? —— 对照的那个"老版本",专业说法叫基线(baseline)。
- 分母是谁? —— 百分比下面那个数。说"省了 27%",那是谁的 27%?
- 属于哪个版本? —— 哪个模型、哪一代、哪一版论文。
三个空填错一个,数字就换了个意思。
最好的反面教材是系列第十篇那份旗舰报告:摘要里"1M 上下文下单 token 计算量只有上一代的 27%“是真的,但媒体写成了"V4 全面打败 GPT-5”。原文其实有三层限定:全文一次都没出现光秃秃的"GPT-5"(只有 GPT-5.2 与 GPT-5.4);“领先"只针对 GPT-5.2 这档,对更新的 GPT-5.4 用的是"略微落后”;连"刷新最强"都自带限定语——只限开源模型。
就像拆快递:新闻稿给你成品,前提、分母、版本三样"包装材料"全扔了——可保质期恰恰印在包装上。
二、看到"比 X 省 Y%",先确认 X 到底是什么
第一道检查:前提验证。 拿到"比 X 省 Y%",先别验算,先问 X 是什么。
真实翻车案例:DeepSeek-V2 报告有人算出新一代的"读书笔记"占用减少了 96.5%,算术全对,结论全错。他把 67B 那代当成了"每层每个字都单独存笔记"的老式注意力(MHA),实际那代用的是省笔记的版本(GQA-8)。前提一换,正确答案是元素口径减少 82.2%、字节口径减少 93.34%。
这里还藏着新手最容易忽略的坑:同一个"减少比例",换个计量单位就是另一个数。“元素"数数字个数,“字节"数占多大存储——两个口径都对,但不能混着说。
第四个子检查:分母结构。 这是全篇最值钱的一条:同一个百分比,换个分母就完全不同。
还是"省 27%"。有人拿"老式稠密注意力"当分母重建,算出比值只有 7.1%——比论文的数字好看得多,但这是假分母。真分母里有个大头:上一代模型在 1M 长度下,光"索引打分"一项就占它总计算量的 93.2%。索引器可以理解成图书馆的检索卡:先靠它挑出该看哪几段,再只算这几段。把这个大头算进去,上一代 1M 长度是 1.124T(T 表示一万亿次运算),新一代 0.304T,比值正好落在 27.0%。
| 分母取法 | 重建出的比例 | 对不对 |
|---|---|---|
| 老式稠密注意力基线 | 7.1% | ❌ 假分母 |
| 含上一代索引器大项(占其总量 93.2%) | 27.0% | ✅ 与论文吻合 |
同一篇论文的读书笔记压缩比例(KV cache,第三篇讲过)按不同记账落在 5.6% 到 15.4% 区间,只有一种组合能得到论文写的 10%;逐层明细账论文没有披露——规范的写法是”论文没有披露",而不是挑一个最漂亮的数写上去。
三、“平均"和"提升"这两个词,最经不起自己算一遍
第二道检查:均值口径问加权。“平均分"听起来最公平,其实最容易动手脚。
以图像生成见长的 Janus 报告给了一个总平均分。有人按"每行同等重要"重算,12 行里 9 行精确吻合,剩下 3 行有小偏差(不超过 0.007),而且方向一致、都偏小。方向一致说明这不像随机误差,更像官方用了加权平均——某些行分量更重。但论文没写明用了什么权重,只能记为"口径未披露”。
加权的意思很朴素:40 人的班和 5 人的班,把两个班的平均分再平均一次,等于让那 5 个人每人说话分量是别人的 8 倍——小组人少却被当同等权重,就是失真来源。
第三道检查:内部算术互检。 这道最好玩——不用懂任何模型原理,会四则运算就能抓错。
Janus 正文有一句"新方法提升了 30%"。可同一篇论文的表格里摆着 48.7 和 59.1:涨了 10.4,10.4 ÷ 48.7 ≈ 21.36%。换什么口径都救不回 30% 这个说法。
同类案例:一篇讲模型配比的报告,用正文自己给的三个数(1152 × 2048 × 40000)乘出来是 94.37B,而正文写的是"100B”。
方法:看到"提升 X%",把前后两个数字抄下来自己除一遍;某个公式在一行上吻合,就拿去验别的行——能验出错的公式,才算真懂了一半。
四、同一件事,摘要、正文、表格可能各说一套
第四道检查:数值一致性跨节扫。 论文不是一个作者一口气写完的,摘要、正文、表格、附录可能出自不同人的手。
记录在案的例子:一篇讲训练配比的报告,结论小节写"300B tokens”,而摘要、正文主体和附录三处都写"200B"(token 就是第三篇讲的"词元")。按多数口径这本该记为笔误,但纪律要求是——分歧全部如实并列,不得擅自取舍。写笔记时不能写"我判断是 200B 所以不提 300B",而要写"论文里同时存在两种写法"。
同类小例子:Prover 报告里同一指标一处写 148、一处写 149;某微调报告的表 3 末行写 33.8、表 1 写 33.6。
第一个子检查:错标定位。 这一条说的是"数字没错,只是挂错了地方"。
Engram 那篇的摘要声称某测试提升了 +3.4。回到表格逐格复算,实际是 +3.0。而 +3.4 并非凭空来的——它恰好精确对应另一个更难版本的测试(64.0 减 60.6)。即摘要把 B 测试的差值挂到 A 测试名下。未必是造假,可能只是行错位,但结论一样:引用以表格为准,摘要的说法降级处理。
五、分数高不高,还取决于数据干不干净
第五道检查:数据卫生与泄漏。 这条最隐蔽:数字可以算得完全正确,含义却已经被改变。
比方说:考卷提前当练习题做过,分数当然好看——但证明的不是能力。
- 评测集进了训练流。 Prover-V1.5 报告如实记录:它要用来考试的测试集(miniF2F、ProofNet-valid)曾出现在训练数据里,而这类训练叫 SFT(用标准答案教模型做题)。论文自己写出来了,这点反而值得肯定。
- 基座被"净化"过。 另一篇微调报告为了让效果好看,刻意把数学和代码数据从底模里剔掉,等于先弄差、再"改进"回来。所以那张表里的"原版成绩"和同规模官方成绩不是一回事,不能直接比。
论文若没做污染检查,不能替它假设"应该没问题",只能写"论文没有披露"——四个字比猜测值钱。
六、一个数字属于哪个模型、哪个版本
第六道检查:引用归属与版本漂移。 版本漂移指论文改版后数字跟着变。
- 一个 0.80 的分数常被挂在"Janus-1.3B"名下,逐条回溯原表,它其实属于更大的 Janus-Pro-7B;流传的"11B 的 JanusFlow"也是讹传,那个模型只有 1.3B。
- 软件的版本会漂移,论文的版本也会:V3 报告从第 1 版到第 2 版重写了低精度数值累加那段,“34-bit"这个说法只存在于第 1 版。引用论文要连版本号一起记。
- 媒体转述最常删的是语气和条件。某条 OCR(文字识别)线热传的"10 倍无损"“20 倍仍有 97%““100 个 token 击败所有 OCR”,回原文逐字核对全是带条件的句子;而"Tesseract”(一个老牌开源识别工具)全文出现 0 次。
第二个子检查:谱系主张 ≠ 架构继承。 中文技术文章爱写"某技术继承自某某”,但谱系要分三档:
| 档位 | 证据 | 能否说"继承” |
|---|---|---|
| 引用 | 参考文献里引了那篇 | ✅ 可以 |
| 正文用词 | 正文点名提到 | ✅ 可以 |
| 只是时间先后/社区叙事 | 没有引用 | ❌ 只能说"教学上相似" |
案例:新一代稀疏注意力(DSA)与更早的 NSA 常被写成一条线,但 DSA 正文里"NSA"出现 0 次,架构也不同;参考文献里倒是引了 NSA。所以两者有引用关系,但"生产继承"论文里没这个说法,只能算教学组织方式。没引用的谱系是故事,不是证据。
第三个子检查:互不引用 ≠ 交锋。 还有一篇批评文和 DeepSeek 的 OCR-2,双方全文互不引用(一方连 56 条参考文献都做过字节级检索,0 命中)。而且两者谈的不是同一件事:一个质疑"通用压缩有没有必要",一个回答"文档解析里的读取顺序怎么定"——射程不重叠,是互补而非吵架。 所以看到"某文没回应批评",先核对批评有没有覆盖对方主张,别把"不回应"当"理亏"。
七、最值得信任的材料,是肯说自己落后的那种
这门手艺不只用来防骗,也用来选材料。
那份旗舰报告主动写了:自己的发展轨迹比最强的前沿模型落后大约 3 到 6 个月;“领先"的限定是开源模型;唯一一条"追平闭源"的断言被限定在单个任务上。更关键的是,它的表格里留着自己输掉的格子:跟上一代比有 3 项没超过(87.5 对 87.6 只差 0.1,另两项差 1.7 和 4.7 是真实落后);跟最强对手比时,某道难题测出 95.2,而对手是 97.7。
为什么这种材料更可信? 因为它有能力把不好看的数字留在桌上。只挑有利格子的报告,你无从判断剩下的格子里藏着什么——肯认输的地方,就是校准你信任度的锚点。 而讹传的典型手法,恰恰是把"自认落后"整段删掉。
三条实操建议,请带走:
- 看到任何百分比,先问分母是什么。 说不清分母,这个数字先不要用。
- 看到"超越”,先去找论文原文的措辞。 新闻稿通常比论文激进;论文里的限定语(哪个对手、哪个版本、什么条件)就是它的诚实刻度。
- 看到"某某技术继承自某某",先查有没有引用。 有引用才是谱系,没引用只是巧合或叙事。
最后回到这个系列本身。我们花了十二篇讲注意力、专家团、压缩、多模态,但这套论文最值得学的不是那些结论——结论都会过时——而是这种对数字的谨慎。 技术会继续换代,模型会越来越强,而"看到数字先问它跟谁比、分母是谁"这个习惯是你自己的判断力,不会随版本更新而失效。
一句话总结: 论文里的每个数字都是一句被压缩的话,你要做的不是记住它,而是把被删掉的前提——基线、分母、版本——重新展开,再决定信不信。
记住这个方法: 看到数字先问分母。同一个"省 27%",用错分母能算出 7.1%,用对分母才是 27.0%——分母说清了,数字才存在。
下一篇: 同样一万张卡,怎么花出两倍效果——带着这套检查清单,去看一份真的能被逐项相加的成本账。