最像真题的那本计组书,其实最不教你原理
上一篇我们算出:计组教材里,袁春风最贴近真题。 这一篇把范围扩到 8 本计组书(教材 + 习题册 + 试题解析),又算了一遍,结果出来一条反直觉的梯度—— 最像真题的根本不是任何教材,是《试题解析》。原因也直白:它直接把真题收了进去。 "一本资料读起来很像真题",常常只说明它装着真题,跟它能不能讲明白原理,没有关系。
1. 一个很多人没想清楚的问题
选复习资料时,有个朴素信念几乎人人都有:越像真题的,越好。
听起来天经地义。但"像真题"到底是个好信号,还是个陷阱?我们手上有 235 道计组真题、和 8 本计组书的全文,正好能把这件事量出来——用的还是上一篇那套语义距离的方法(把每道真题和每本书的每一段都变成向量,比谁最接近)。
2. 一条干净的三层梯度
把每本书对计组真题的平均贴近度排出来,是这样:

清清楚楚三层:
| 层级 | 代表 | 贴近度 |
|---|---|---|
| 真题导向《试题解析》 | 白中英《试题解析》 | 0.871(最像) |
| 配套习题 / 解答 | 蒋本珊《习题解析》0.846、袁春风《习题解答》0.794 | 中间 |
| 教材正文 | 袁春风 0.765、白中英 0.736、蒋本珊 0.733、唐朔飞 0.727 | 最低 |
越是"以题为中心"的书,越像真题;真正讲原理的教材正文,反而排在最后。
3. 为什么?因为它"装着"真题
这条梯度的原因很直接:
《试题解析》这类书,本来就是逐题收录、拆解历年真题的。 算法把真题拿去跟它比,当然判它最像,几乎是同义反复——这是它的设计目的。
所以"像真题"这个直觉在这儿会失灵:
一本资料"读起来很像真题",往往只是因为它把真题装在里面了。这跟它能不能讲明白为什么,是两件不同的事。
教材正文反过来,讲的全是原理——补码为什么这样设计、流水线为什么会冒险、控制信号怎么一步步生成。这些内容和真题的题面长得不像,所以离真题最远;但它决定你下次能不能自己做出来。
4. 这主要是计组现象
把同样的对比放到四科上看,有个边界得讲清楚:

"题集比教材更像真题"这个差距,计组最明显(+0.07),数据结构其次(+0.03),操作系统和计算机网络几乎没有、甚至倒过来。原因也好理解:计组、数据结构有成熟的"真题反推题集"生态,操作系统和计网没那么卷。
这篇的结论,只对计组(和部分数据结构)成立,不是四科通用的规律。
5. 方法与边界
方法:同上一篇第 6 节——每道真题(只取题干+选项)和每本书每一段算余弦相似度,取最近邻。两个不同团队的嵌入模型交叉验证,梯度结论一致。
"语义相似"不等于"命题同源":相似度高只说明文字像。但《试题解析》收录真题是公开事实,"它装着真题"这句话站得住。
只比了"像不像真题"一个维度,不是给这些书的整体质量打分。试题解析、习题册都是好资料,只是各管各的用途。
想按知识点、年份拆开看 235 道计组真题,可以在这里:计组真题库。