延伸阅读与来源索引
一本书不可能替读者读完所有论文,也不应让几百条参考文献变成一堵没有入口的墙。本附录的作用,是把全书已经引用的原始论文、教材、综述、评测和标准重新组织成可以执行的阅读路线。
这里不是参考文献表的重复版本。文末参考文献回答“本书用了哪些来源”,本附录回答另外三个问题:
- 想把某一主题继续读深,应先读什么、后读什么?
- 一份材料适合用来理解历史、学习机制、复现结果,还是判断现实影响?
- 面对不断更新的模型、产品和政策,怎样保留可以复查的阅读记录?
读者不必从头读到尾。先选择自己的目标,再进入相应路线即可。
先选择阅读深度
主线读者:把概念连成一条路
目标是理解 AI 为什么经历规则、学习、深度网络、基础模型和智能体这些变化。每个主题只需完成三步:
- 先读本书对应章节,建立问题和词汇;
- 再读一篇历史材料、综述或教材章节;
- 最后读一篇标志性论文的摘要、引言、图表和局限。
主线读者不必逐式推导,也不必复现全部实验。能够回答“它解决了什么旧问题、依赖什么条件、还不能做什么”,就已经读到了关键处。
工程读者:追踪输入、输出和训练目标
除了主线问题,还要追踪:数据怎样进入系统,张量怎样变形,损失函数优化什么,训练和部署各需要什么资源,评测协议是否能支持论文的结论。建议把必要的数学准备放在手边,并给每篇论文画出一条最小数据流。
工程阅读的最低产物不是“我看懂了”,而是一页说明:
- 输入、输出与主要张量形状;
- 模型结构和目标函数;
- 数据来源与切分方式;
- 训练预算、推理预算和外部工具;
- 主实验、消融实验与已知失败模式。
复现读者:把论文结论变成可失败的实验
复现不是运行作者仓库后得到一张相似截图。先选择要复现的最小结论,例如“残差连接使更深网络更容易优化”,而不是“重新训练完整模型”。随后固定版本、随机种子、数据切分、硬件、运行次数和评价指标,并预先写下什么结果会使复现失败。
对大模型和机器人系统,原论文规模通常超出个人预算。此时可以复现机制,不冒充复现规模:使用较小模型验证因果掩码、缩放点积注意力、检索增强或闭环控制的作用;不能由小实验推出原系统的绝对能力。
不同来源承担不同证据任务
- 原始论文最适合确认作者提出了什么方法、怎样实验和如何限定结论。它不自动代表方法已经被独立复现。
- 教材适合补齐共同语言、推导和成熟方法之间的关系。教材出版较慢,不适合确认最新产品状态。
- 综述与历史著作适合建立全景和争议线索。它们的叙事选择仍需回到一手材料核对。
- 技术报告与系统卡适合了解模型、数据、算力、评测和部署约束,但开发者也是利益相关方。
- 基准及其数据说明定义“分数究竟测了什么”。只看排行榜而不看任务样本和协议,无法解释排名。
- 独立复现与对抗测试能检查结果是否依赖作者代码、特定提示或隐藏条件。一次复现失败也可能来自实现差异,需要说明偏差来源。
- 标准、法规和治理框架定义风险过程、责任和适用范围。提案、指南、标准、已通过法规和已生效规则不是同一种状态。
- 部署研究最接近真实影响,却会受到组织流程、用户选择和时间变化的共同影响。
判断一项历史事实,优先找同期论文、档案或当事人的原始记录;学习一个成熟算法,教材往往比最早论文更清楚;判断一项当代能力,则要把系统报告、基准、独立测试和部署条件放在一起。来源没有抽象的“最高等级”,只有是否适合当前问题。
路线一:智能的观念、逻辑与计算
先读第 1 章至第 4 章,再用 Nilsson 的 AI 史建立研究路线之间的联系。(Nilsson 2010年) 若想贴近原始材料,可以依次抽读 Lovelace 对分析机的注释、Boole 的逻辑代数、Church 与 Turing 对可计算性的形式化、Shannon 的继电器电路与信息论,以及 Wiener 的控制论。(Lovelace 1843年; Boole 1854年; Church 1936年; Turing 1937年; Shannon 1938年, 1948年; Wiener 1948年)
最后对读 Turing 1950 年的论文与达特茅斯提案。前者讨论“机器能否思考”应怎样转化为可讨论的问题,后者展示一个新研究领域怎样为自己划定议程。(Turing 1950年; McCarthy 等 1955年) 阅读时特别标记:哪些句子是技术结果,哪些是研究计划,哪些只是面向未来的判断。
推荐产物:画一条从“可形式化规则”到“可计算过程”再到“学习系统”的概念链,并为每个箭头写出一个它没有解决的问题。
路线二:经典机器学习与强化学习
先读第 8 章至第 12 章。Mitchell 适合建立假设空间、泛化和归纳偏置的基本语言;Hastie 等与 Bishop 更适合继续学习统计学习、概率模型、正则化和模型选择。(Mitchell 1997年; Hastie 等 2009年; Bishop 2006年)
随后把算法放回原始转折:感知机、支持向量机、随机森林和提升方法分别展示了线性学习、间隔、集成与逐步纠错的不同思路。(Rosenblatt 1958年; Cortes 和 Vapnik 1995年; Breiman 2001年; Freund 和 Schapire 1997年) 不要只背算法清单,要比较它们的表示能力、优化目标、数据要求和失败模式。
强化学习以 Sutton 与 Barto 的教材为主线,再读 Q-learning 和 DQN 的论文。(Sutton 和 Barto 2018年; Watkins 和 Dayan 1992年; Mnih 等 2015年) 先在表格型环境中确认状态、动作、奖励、回报和探索,再进入函数逼近。若还不能解释“监督标签”和“延迟奖励”的差异,不宜直接从深度强化学习代码开始。
最小复现顺序:逻辑回归或决策树 -> 线性 SVM -> 小型集成模型 -> 网格世界 Q-learning -> 固定小游戏上的 DQN。每一步只增加一种主要复杂性。
路线三:深度学习与表示学习
配合第 13 章至第 18 章,先用反向传播原始论文理解链式法则怎样在分层表示中复用,再阅读 LeNet、AlexNet、ReLU 初始化和 Adam。(Rumelhart 等 1986年; LeCun 等 1998年; Krizhevsky 等 2012年; He 等 2015年; Kingma 和 Ba 2015年)
这一组论文跨越近三十年,不能把性能变化只归因于“网络更深”。记录每项工作同时改变了哪些条件:数据规模、硬件、激活函数、正则化、优化器、工程实现和评测任务。模型架构只是一条因果链中的一环。
序列与生成路线可以从 LSTM、VAE 和 GAN 三篇代表论文进入。(Hochreiter 和 Schmidhuber 1997年; Kingma 和 Welling 2014年; Goodfellow 等 2014年) 比较三者时,不要只看样本图:写清楚似然或下界是否可计算、训练目标是否稳定、潜变量怎样使用,以及评测是否覆盖多样性和失真。
最小复现顺序:多层感知机与梯度检查 -> 小型 CNN -> LSTM 序列分类 -> 二维 VAE -> 小图像 GAN。Goodfellow 等的深度学习教材可作为跨主题参考,而不是必须顺序读完的大部头。(Goodfellow 等 2016年)
路线四:注意力、Transformer 与预训练
先读第 19 章至第 21 章,再按问题演变阅读 Bahdanau 注意力、Transformer、BERT、GPT 和 T5。(Bahdanau 等 2015年; Vaswani 等 2017年; Devlin 等 2019年; Radford 等 2018年; Raffel 等 2020年)
第一次读 Transformer 论文,只追踪一个 Token 如何经过嵌入、位置表示、多头注意力、残差、归一化和前馈网络。第二次再核对矩阵形状、复杂度与掩码。第三次才比较编码器、解码器和编码器-解码器的训练目标。P08 的迷你 Transformer 实践适合验证这些局部机制。
预训练路线还需要补上规模规律与计算配比。GPT-3 展示上下文学习的规模效应,Kaplan 等和 Chinchilla 工作则给出不同条件下的经验缩放关系。(Brown 等 2020年; Kaplan 等 2020年; Hoffmann 等 2022年) 这些是特定模型族、数据和预算下的经验结果,不是无限外推的自然定律。基础模型综述适合把能力、同质化、数据、劳动、环境和治理风险放回同一张图。(Bommasani 等 2021年)
工程加餐:掌握标准注意力后再读 FlashAttention,区分数学函数不变与内存访问方式改变。(Dao 等 2022年)
路线五:生成模型、指令对齐与助手
扩散模型路线从第 22 章进入,依次阅读 DDPM、基于分数的生成建模和潜空间扩散。(Ho 等 2020年; Song 等 2021年; Rombach 等 2022年) 第一遍只回答前向过程加了什么噪声、反向过程预测什么;第二遍再比较参数化、采样步数、条件控制和计算位置。
助手路线从第 23 章进入。偏好学习、InstructGPT 和 DPO 分别提供了从人类比较中学习、构建指令助手和简化偏好优化的关键入口。(Christiano 等 2017年; Ouyang 等 2022年; Rafailov 等 2023年)
阅读对齐论文时,至少分开记录三件事:底层模型原有能力、训练后行为变化、部署系统额外限制。偏好数据代表某些标注者在某些任务上的选择,不自动等于事实正确、普遍价值或完整安全。
推荐实验:在小型分类或文本偏好数据上比较监督微调与成对偏好目标,观察奖励、准确性、输出长度和分布外表现是否一起变化。不要把一个代理指标的提升称为“完成对齐”。
路线六:多模态、推理、检索与智能体
从第 25 章开始,用 CLIP 理解图文对比学习,再比较 Flamingo 与 BLIP-2 怎样连接视觉编码器和语言模型。(Radford 等 2021年; Alayrac 等 2022年; Li 等 2023年) 重点不是背组件名称,而是追踪视觉信息以什么表示进入语言生成,以及训练时哪些模块被冻结。
第 26 章对应的阅读顺序是思维链、自洽性、树搜索和过程验证。(Wei 等 2022年; Wang 等 2023年; Yao, Yu, 等 2023年; Lightman 等 2023年) 把“产生更多中间 Token”“搜索更多候选”和“拥有可靠推理能力”分开;测试时计算只有在候选具有多样性、评分器有辨别力且预算可接受时才可能转化为收益。
第 27 章和第 28 章可沿 RAG、ReAct 与 Toolformer 阅读。(Lewis 等 2020年; Yao, Zhao, 等 2023年; Schick 等 2023年) 一次问答成功不能代表长任务可靠。SWE-bench 与 OSWorld 把评测推向真实代码仓库和计算机环境,也同时暴露环境配置、评分器、权限和可重复性问题。(Jimenez 等 2024年; Xie 等 2024年)
最小系统复现:固定文档集的检索问答 -> 带来源核对的回答 -> 两个只读工具 -> 有最大步数和失败恢复的循环。每次只开放一项能力,并记录端到端成功率,而不是只展示成功轨迹。
路线七:机器人与 AI for Science
第 29 章需要把模型输出重新放回感知、控制和安全闭环。RT-2 展示视觉语言模型与机器人动作的连接,DreamerV3 展示学习世界模型后进行决策的一条路线。(Brohan 等 2023年; Hafner 等 2023年) 阅读时检查训练环境、动作空间、控制频率、人工干预、失败恢复和现实测试次数;视频中的一次成功不足以给出可靠率。
第 30 章可按“预测 -> 搜索 -> 验证”组织来源。AlphaFold 2 与 AlphaFold 3 对应结构预测范围的扩展,GNoME 对应材料候选发现,GraphCast 对应天气预测,FunSearch 与 AlphaGeometry 对应程序和证明搜索。(Jumper 等 2021年; Abramson 等 2024年; Merchant 等 2023年; Lam 等 2023年; Romera-Paredes 等 2024年; Trinh 等 2024年)
最重要的阅读问题是:论文报告的是计算指标改善、候选被实验确认,还是已经改变科学与工程流程?模型提出候选不等于实验验证,实验验证也不等于规模化制造、临床有效或长期部署。
推荐产物:为一篇科学 AI 论文画证据链,明确数据来源、预测目标、搜索空间、验证手段和最终现实结论之间的每一步。
路线八:评测、安全、治理与社会影响
先读第 31 章,再把 MMLU、BIG-bench、HELM、GPQA 等材料当作“测量仪器说明书”阅读,而不是只抄分数。(Hendrycks 等 2021年; Srivastava 等 2023年; Liang 等 2023年; Rein 等 2024年) 代码评测可对读 HumanEval 与 EvalPlus,观察测试套件加严后结论怎样变化。(Chen 等 2021年; Liu 等 2023年)
第 32 章可结合模型卡、数据说明表、NIST AI 风险管理框架和通用语言模型风险分类。(Mitchell 等 2019年; Gebru 等 2021年; National Institute of Standards and Technology 2023年; Weidinger 等 2022年) 它们分别处理模型披露、数据治理、组织风险过程和风险空间,不能互相代替。
第 33 章涉及劳动和教育时,应区分任务暴露、采用率、生产率、就业数量、收入分配和工作质量。Autor 与 Acemoglu 提供自动化的长期分析框架,生成式 AI 的受控实验与现场研究则提供较近的任务级证据。(Autor 2015年; Acemoglu 和 Restrepo 2019年; Noy 和 Zhang 2023年; Brynjolfsson 等 2025年) 教育材料还应同时检查学习目标、评估方式、隐私和教师责任。(UNESCO 2023年)
推荐产物:选择一条现实新闻,用AI 新闻判断框架建立证据卡。将“技术可行”“组织采用”和“社会净影响”分别给出结论,不用一个模型分数代替三者。
路线九:AGI 与未来判断
第 34 章刻意不提供单一倒计时。Chollet 从技能获取效率讨论智能,Morris 等尝试用能力广度、表现等级和自主程度描述 AGI,Lake 等则从人类式学习能力提出研究缺口。(Chollet 2019年; Morris 等 2024年; Lake 等 2017年)
把这些定义与 Sutton 的“苦涩教训”、可扩展监督研究放在一起阅读,可以看到两类不同问题:怎样扩大一般方法的能力,以及能力扩大后怎样提供可扩展、可审计的人类约束。(Sutton 2019年; Leike 等 2018年)
阅读未来预测时,至少记录预测日期、目标定义、时间范围、前提、可观察指标和可能推翻它的事件。没有失败条件的预测更像立场表达,而不是可以更新的判断。
推荐产物:不要写一个年份,写一张状态表。分别评估任务广度、新任务适应、可靠性、现实锚定、资源效率和授权程度,并为每项注明证据日期。
怎样高效读一篇论文
第一遍:判断是否值得深读
先看标题、摘要、引言、主要图表、结论和局限。回答五个问题:
- 论文具体声称解决什么问题?
- 相对什么基线改善?
- 改变的是模型、数据、训练、推理预算还是评测?
- 最重要的证据在哪张表或哪幅图?
- 作者主动承认哪些边界?
若这五项还说不清,不要急着钻进推导。
第二遍:重建方法与比较条件
沿输入到输出画数据流,标出可学习参数、固定组件、损失和推理流程。再检查数据切分、基线实现、超参数搜索、运行次数、误差范围和消融实验。此时应能区分“方法本身带来的改善”和“更多数据、算力或重试带来的改善”。
第三遍:寻找会让结论变弱的证据
主动找失败案例、附录、负结果、误差条和未比较的强基线。随后搜索独立复现、后续批评和数据问题。目标不是驳倒论文,而是确定结论可以安全地走多远。
先写出每个符号的类型和形状,再用一个两行三列的小例子手算。仍然不清楚时,回到公式前面的研究问题:这个量是在打分、归一化、累计证据,还是更新参数?数学附录提供了这套拆解方法。
来源笔记要能被未来的自己复查
每份来源建议保留一张简短卡片:
来源:作者、标题、年份、稳定标识符
版本:会议版 / 期刊版 / 预印本版本与日期
问题:它试图回答什么
对象:模型 / 系统 / 产品 / 部署 / 政策
方法:数据、结构、训练与推理条件
证据:最关键的表、图、实验或条款
结论:材料直接支持的最窄表述
边界:样本、分布、预算、失败模式与利益关系
复查:代码、数据、独立结果、勘误与访问日期
关联:本书章节及其他来源
直接引语要同时保存页码或段落位置;网页要记录标题、机构、发布日期和访问日期;会更新的排行榜要保存快照或精确版本。不要只保存一个可能失效的链接。
把自己的判断与来源原话分开写。一个实用标记法是:F 表示材料直接报告的事实,I 表示根据材料作出的推断,Q 表示尚未解决的问题。以后更新时,便能知道需要替换来源,还是需要修改自己的解释。
怎样核对引用与不断变化的事实
论文题名、作者、年份和标识符应以正式出版页、作者版本或可信索引为准。预印本后来进入会议或期刊时,记录两个版本之间是否改变了数据、实验和结论;不要仅改年份而默认内容相同。
模型、产品、排行榜、价格和政策最容易过期。引用它们时应同时保留:
- 核查日期与地区;
- 模型或产品的精确版本;
- 基础模型还是带工具的系统;
- 评测提示、采样、重试和预算;
- 政策的法律状态、生效时间与适用对象;
- 原页面修改或撤回后的替代来源。
至少用两个不同角色的来源核查强结论。例如,系统能力可以组合开发者报告与独立评测;社会影响可以组合任务实验与部署研究;政策可以组合正式文本与解释材料。两个转载同一新闻稿的网站仍然只有一个信息源。
逐章来源入口
下面给出的不是每章全部引用,而是适合从正文迈向原始材料的第一组入口。
- 第 1 至 4 章:Lovelace、Turing、Shannon、Wiener、达特茅斯提案与 AI 史。(Lovelace 1843年; Turing 1950年; Shannon 1948年; Wiener 1948年; McCarthy 等 1955年; Nilsson 2010年)
- 第 5 至 7 章:早期通用问题求解、物理符号系统、规划与专家系统的原始工作,配合 AI 史判断研究主张和实际系统之间的距离。(Newell 和 Simon 1956年; Nilsson 2010年)
- 第 8 至 10 章:Mitchell 与 Bishop 提供学习、概率、泛化和决策的系统入口,感知机原文提供历史坐标。(Mitchell 1997年; Bishop 2006年; Rosenblatt 1958年)
- 第 11 至 12 章:统计学习、SVM、随机森林、提升、强化学习教材与 Q-learning。(Hastie 等 2009年; Vapnik 1995年; Breiman 2001年; Freund 和 Schapire 1997年; Sutton 和 Barto 2018年; Watkins 和 Dayan 1992年)
- 第 13 至 15 章:反向传播、LeNet、AlexNet、初始化与表示学习的代表材料。(Rumelhart 等 1986年; LeCun 等 1998年; Krizhevsky 等 2012年; He 等 2015年)
- 第 16 至 18 章:LSTM、VAE、GAN、DQN 及强化学习教材。(Hochreiter 和 Schmidhuber 1997年; Kingma 和 Welling 2014年; Goodfellow 等 2014年; Mnih 等 2015年; Sutton 和 Barto 2018年)
- 第 19 至 21 章:Bahdanau 注意力、Transformer、BERT、GPT、T5 与缩放规律。(Bahdanau 等 2015年; Vaswani 等 2017年; Devlin 等 2019年; Radford 等 2018年; Raffel 等 2020年; Hoffmann 等 2022年)
- 第 22 至 24 章:DDPM、分数模型、潜空间扩散、偏好学习、InstructGPT、DPO 与基础模型综述。(Ho 等 2020年; Song 等 2021年; Rombach 等 2022年; Christiano 等 2017年; Ouyang 等 2022年; Rafailov 等 2023年; Bommasani 等 2021年)
- 第 25 至 26 章:CLIP、Flamingo、BLIP-2、思维链、自洽性、树搜索和过程验证。(Radford 等 2021年; Alayrac 等 2022年; Li 等 2023年; Wei 等 2022年; Wang 等 2023年; Yao, Yu, 等 2023年; Lightman 等 2023年)
- 第 27 至 28 章:RAG、ReAct、Toolformer、SWE-bench 与 OSWorld。(Lewis 等 2020年; Yao, Zhao, 等 2023年; Schick 等 2023年; Jimenez 等 2024年; Xie 等 2024年)
- 第 29 至 30 章:RT-2、DreamerV3、AlphaFold、GNoME、GraphCast、FunSearch 和 AlphaGeometry。(Brohan 等 2023年; Hafner 等 2023年; Jumper 等 2021年; Merchant 等 2023年; Lam 等 2023年; Romera-Paredes 等 2024年; Trinh 等 2024年)
- 第 31 至 32 章:MMLU、BIG-bench、HELM、GPQA、HumanEval、EvalPlus、模型卡、数据说明表和 NIST AI RMF。(Hendrycks 等 2021年; Srivastava 等 2023年; Liang 等 2023年; Rein 等 2024年; Chen 等 2021年; Liu 等 2023年; Mitchell 等 2019年; Gebru 等 2021年; National Institute of Standards and Technology 2023年)
- 第 33 至 34 章:劳动与生产率、教育、智能定义、AGI 分级和可扩展对齐。(Autor 2015年; Acemoglu 和 Restrepo 2019年; Noy 和 Zhang 2023年; UNESCO 2023年; Chollet 2019年; Morris 等 2024年; Leike 等 2018年)
每章末尾和全书参考文献仍保留更完整的来源。这里的入口只负责帮助读者迈出第一步。
一条十二周学习路线
这条路线按每周 5 至 8 小时设计,重点仍是理解内容,实践只占较小部分。时间不足时,可以把每一周延长为两周。
第 1 至 2 周:问题从哪里来
读序章和第 1 至 7 章;选读 Turing 1950、达特茅斯提案和一部 AI 史。产物是一页时间线和一页“规则系统的能力与边界”。
第 3 至 4 周:机器怎样从数据学习
读第 8 至 12 章和数学附录的概率、梯度部分;选读一本机器学习教材与强化学习教材的入门章节。可选实践是逻辑回归和网格世界 Q-learning。
第 5 至 6 周:深度网络怎样训练
读第 13 至 18 章;精读反向传播、CNN、LSTM、VAE 或 GAN 中两篇论文。产物是一张训练数据流和一份梯度检查记录。
第 7 至 8 周:从注意力到基础模型
读第 19 至 24 章;精读 Transformer,再在 BERT、GPT、扩散和对齐中选择两条支线。可选完成 P08,但只要求解释每个张量和掩码,不追求大规模训练。
第 9 至 10 周:模型怎样成为系统
读第 25 至 30 章;在多模态、推理、RAG、智能体、机器人和科学 AI 中选择两组原始材料。产物是一张包含工具、权限、验证和失败恢复的系统图。
第 11 周:怎样测量与治理
读第 31、32 章和一个基准的数据说明,再读模型卡、数据说明表或风险管理框架。选一张排行榜,重建它的任务、协议、评分和预算。
第 12 周:把结论放回社会与未来
读第 33、34 章以及本书三个判断型附录。选择一条当周 AI 新闻,制作来源卡和证据链;最后写下现在能确认什么、仍不知道什么、什么新证据会改变判断。
最后的阅读检查表
完成一个主题后,检查自己能否回答:
- 我读的是历史记录、方法论文、系统报告、基准、标准,还是部署研究?
- 核心主张的对象是模型、系统、产品、现实影响还是政策?
- 输入、输出、训练目标和运行条件是什么?
- 比较基线是否公平,数据是否可能污染,结果有没有不确定性?
- 改善来自方法、数据、算力、工具、重试还是人工帮助?
- 论文直接证明了什么,哪些只是作者或我自己的推断?
- 结论在哪些分布、预算、版本和日期下成立?
- 是否有独立复现、失败案例、后续修正或利益关系?
- 我能否用一句更窄、更准确的话复述结论?
- 下一份材料应该补机制、补反例,还是补现实部署证据?
延伸阅读的终点不是收藏更多链接,而是让自己的判断可以追溯、可以被反驳,也可以随着新证据更新。AI 会继续变化;一套知道该问什么、到哪里找证据、怎样缩小结论的方法,比任何静态的“最新清单”更耐用。