第24章 大模型究竟学到了什么

问一个语言模型“法国的首都是哪里”,它可能回答“巴黎”。这个答案看起来像知识。但仅凭输出,我们还不知道答案怎样产生。

模型可能在训练中见过这句话并记住了常见续写;也可能把“法国”“首都”和“巴黎”分散出现的关系组合起来;还可能受到提示中的示例、检索结果或对话前文影响。相同答案可以来自不同内部路径。

因此,“模型学到了什么”不能只靠一次问答判断。我们至少要区分三类证据:它在什么输入上表现出能力;内部状态中能读出什么信息;改变某个内部组件是否会稳定改变行为。

本章不会给“模型是否真正理解”一个口号式结论,而是建立一套证据强度:从行为测量到表征探针,再到因果干预,逐步缩小合理解释的范围。

参数不是一本逐条可查的百科全书

语言模型通过最小化预测损失调整大量参数。训练数据中的事实、语法和格式被压进分布式计算中,并不天然带有来源、日期和真值字段。

Petroni 等人用填空式提示测试预训练语言模型能否回答事实关系,发现部分关系可以直接从参数中唤起。(Petroni 等 2019年) 这类结果支持“参数包含可用事实信息”,却不意味着参数像数据库行一样保存每条知识。

同一事实的表达会分散在许多文档与上下文。一次前向计算又会让 Token 表示经过多层注意力和前馈网络组合。知识可能分布在多个权重、激活和计算路径中。

这带来实际差异:数据库可以为一条记录附来源、更新时间和唯一键;语言模型通常只给出条件概率。它可能把互相冲突的版本混合,也可能知道事实却无法在当前提示下调用。

记忆与泛化不是非黑即白

记忆通常指模型对训练样本或其独特片段保留高度特定的信息;泛化指模型能把训练中学到的规律用于新的组合或样本。

两者可以同时发生。模型既能学会英语语法,也可能记住重复出现的电话号码;既能组合代码模式解决新问题,也可能复述公开仓库中的函数。

可以把情况放在一条连续谱上:

行为 更接近记忆 更接近泛化
逐字续写一段独特训练文本
改写熟悉事实
用已学规则解决新组合

Carlini 等人从语言模型中提取出部分训练文本,证明足够大的模型会泄漏某些可识别样本,重复和罕见序列尤其值得关注。(Carlini 等 2021年) 这证明“可能记忆并泄漏”,不证明模型的每个回答都是复制粘贴。

判断记忆需要知道训练集、构造近邻对照并测量逐字或近似匹配。只因一句话“听起来常见”,不能判定它来自哪条训练记录。

核心机制:同一能力需要多层证据

行为测试说明模型在某些输入上能做什么;表征分析说明内部状态中可读出什么;因果干预说明某个状态或组件是否实际参与输出。三类证据逐层加强,但任何单次实验都受提示、数据、模型版本和指标限制。

行为评测首先要排除捷径

如果模型在测试集上得分高,至少有四种可能:

  • 它学到了任务所需规律;
  • 测试题或近似版本出现在训练数据中;
  • 数据中存在标签泄漏或表面捷径;
  • 评测格式恰好迎合模型熟悉的模板。

可靠评测需要时间切分、污染检查、对抗改写和分布外样本。还要报告生成设置:温度、提示、示例和答案解析规则都可能改变分数。

“模型答对了”是重要证据,却只证明这次输入和评测流程下产生了正确输出。它不自动说明模型使用了人希望的理由。

探针:内部表示中能读出什么

模型每层会产生隐藏向量 \(h\)。研究者可以冻结模型,再训练一个简单分类器从 \(h\) 预测词性、实体类别或真假标签,这叫作探针(probe)。

线性探针可以写成:

\[ \hat y=\operatorname{softmax}(Wh+b) \]

若探针准确率高,说明这些标签信息能以线性方式从表示中读出。但探针自身也在学习。复杂探针可能从微弱线索中重建任务,给人“模型已经显式表示该概念”的错觉。

更关键的是,可读出不等于被模型使用。一个人的书桌上放着计算器,不证明他刚才一定用计算器得出答案。要判断因果作用,需要进一步干预。

技术深潜:替换激活并测量输出变化

设模型对输入 \(x\) 给答案 \(y\) 的某个得分为 \(f(x)\)。在第 \(l\) 层把位置 \(i\) 的激活 \(h_i^{(l)}\) 替换为对照值 \(\tilde h_i^{(l)}\),得到干预输出 \(f_{\mathrm{do}}(x)\)。可以定义效应:

\[ \Delta_{l,i}=f(x)-f_{\mathrm{do}}(x) \]

若在多组严格对照中,替换某类激活稳定降低正确答案得分,说明该位置和层对行为具有因果贡献。还可以把干净输入的激活补入受损输入,观察能力是否恢复。

事实定位与编辑研究尝试识别哪些中间状态和参数更新会改变特定事实回答。(Meng 等 2022年) 这比只看相关热力图更强,但仍有边界:

  • 一个事实可能有冗余路径,破坏一处不一定消失;
  • 编辑可能影响相邻事实或只在部分提示上有效;
  • 定位到某层不等于定位到人类可命名的单一“知识单元”;
  • 实验结论可能只适用于特定架构与任务。

因果干预需要同时报告目标效果、旁路效果、跨提示泛化和持久性。

机械可解释性试图读懂计算回路

机械可解释性(mechanistic interpretability)希望把模型行为分解成较小的计算组件,例如注意力头怎样复制前文模式,前馈层怎样写入或读取特征。

Olsson 等人研究了与上下文学习相关的归纳头(induction heads):当序列出现类似“A B … A”时,某些注意力模式倾向从前一个 A 后面复制 B。(Olsson 等 2022年) 这是一个具体、可干预的候选回路,不是对全部上下文学习的完整解释。

大型模型存在多层、多头、残差通路和非线性特征叠加。同一个神经元可能参与多个概念,一个概念也可能分布在大量单元中。找到几个可解释头并不能说明剩余计算已被理解。

好的机制结论应当能预测新输入上的行为,并在消融、激活修补或参数编辑后得到预期改变。

上下文学习发生在参数不变时

第 21 章已经说明,上下文学习通常不更新参数。提示中的示例作为 Token 进入模型,改变隐藏状态和后续分布。

这意味着模型可以在一次前向过程中临时形成任务规则:

示例:红 -> A,蓝 -> B
问题:红 -> ?

模型回答 A,可能利用复制模式、语义关系或训练中学到的元学习策略。不同任务和模型可能依赖不同机制,不能用一个回路解释所有上下文学习。

参数存放的是产生这类临时计算的能力;具体示例和临时状态留在当前上下文。窗口结束后,它们不会自动写回长期参数。

“涌现”可能来自能力,也可能来自尺子

一些研究观察到,模型规模增加时,某些任务准确率长期接近随机,随后在更大模型上突然提高,并称之为涌现能力(Wei 等 2022年)

但离散指标会制造阈值。假设模型给正确答案的连续得分随规模平滑提高,只有超过错误答案才记为 1 分。许多样本在相近规模跨过阈值时,准确率曲线就会像突然跳升。

连续变化:正确答案概率 0.30 -> 0.40 -> 0.49 -> 0.52
离散评分:       错   ->  错   ->  错   ->  对

Schaeffer、Miranda 与 Koyejo 展示了指标选择怎样造成部分表观涌现。(Schaeffer 等 2023年) 这不证明所有涌现都是幻象。组合能力也可能真的出现阈值行为,例如多个必要子能力都达到最低水平后,完整任务才成功。

因此,报告涌现应同时给出连续损失、概率、校准、样本分布和不同指标,而不是只展示一条准确率折线。

技术深潜:度量函数会改变曲线形状

设规模为 \(s\),正确答案得分为 \(z_c(s)\),最高错误答案得分为 \(z_w(s)\)。选择题准确与否由:

\[ a(s)= \mathbf{1}\left[z_c(s)>z_w(s)\right] \]

决定。即使两个得分都随 \(s\) 平滑变化,指示函数 \(\mathbf{1}[\cdot]\) 仍会在交叉点从 0 跳到 1。

若改用正确答案概率或对数几率差:

\[ m(s)=z_c(s)-z_w(s) \]

可能看到更连续的改善。反过来,即使平均概率平滑,某个真实任务也可能需要多个步骤全部正确,成功率会近似相乘并迅速变化。

判断涌现需要区分:模型内部或行为能力是否非连续变化,还是评测把连续变化阈值化。两者可以同时存在。

幻觉是生成机制与知识边界的交汇

幻觉通常指生成内容与可验证事实、给定来源或任务约束不一致。它不是一种单一故障。综述研究区分了与输入冲突、与外部事实冲突等多种情况。(Ji 等 2023年)

产生幻觉的原因可能包括:

  • 训练目标奖励连贯续写,不直接验证事实;
  • 参数知识缺失、过时或互相矛盾;
  • 提示要求超出模型能力,却没有允许拒答;
  • 解码采样选择了低概率错误路径;
  • 长上下文中的证据没有被正确读取;
  • 对齐训练奖励完整、自信的回答风格;
  • 检索或工具提供了错误、缺失或被污染的信息。

更大模型可能在许多任务上减少错误,却不能从目标函数上保证零幻觉。只要系统必须在不完全知识下继续生成,就需要校准、引用、检索、工具验证和允许中止。

模型自述不是内部测量

询问模型“你为什么这样回答”,得到的是另一次条件生成。解释文字可能有用,也可能是事后构造的合理故事。

同样,长思维链可以暴露可检查步骤,却不保证每个文字步骤忠实对应内部计算。要验证解释,应改变被声称重要的输入或中间状态,观察输出是否按解释预测改变。

把模型自述当作待检验假设,比把它当作内部录像更稳妥。

一条证据强度梯子

研究模型内部时,可以按以下顺序提高结论强度:

  1. 单例观察:一个提示下出现某行为;
  2. 系统行为评测:多样本、多提示、独立测试;
  3. 表征相关:探针或可视化读出信息;
  4. 局部干预:消融、替换或修补改变行为;
  5. 机制预测:回路模型预测新样本与新干预;
  6. 跨模型复现:结论在不同规模、架构与训练中成立。
图 1: 理解模型内部的证据从单例观察、系统行为评测和表征相关,逐步增强到局部干预、机制预测与跨模型复现;越高层的结论通常越强,成本与控制要求也越高。

越往后,结论越强,成本也越高。媒体演示常停在第一层,却使用第六层的语言,这是判断 AI 新闻时需要警惕的信号。

学习路径:记忆、泛化与干预小实验

实践继续后置。可以用 P08 的小模型做一组受控实验:

  1. 在训练语料中加入少量独特字符串和大量可组合规则;
  2. 分别测试逐字提取、改写提问和未见组合;
  3. 训练线性探针读取某类 Token 属性;
  4. 随机化标签作为探针对照,检查探针是否只是记住样本;
  5. 遮挡注意力头或替换中间激活,观察行为是否按假设变化;
  6. 报告成功与失败输入,不只展示最漂亮案例。

这个实验不能回答意识问题,却能训练最重要的研究习惯:让结论强度与证据强度匹配。

本章小结

  • 参数可以包含可调用的事实与结构,但不像数据库那样逐条保存来源和真值。
  • 记忆与泛化可以同时存在;训练数据提取证明隐私风险,不证明所有输出都是复制。
  • 行为评测、表征探针和因果干预回答不同问题,证据强度逐层提高。
  • 探针能读出信息不等于模型实际使用信息;机制解释需要干预与新样本预测。
  • 上下文学习在参数不变时通过当前激活发生,具体机制可能不止一种。
  • 离散指标会把平滑能力变化变成表观跳跃,涌现结论必须检查度量与样本分布。
  • 幻觉来自生成目标、知识边界、提示、解码与外部系统的共同作用,不会仅靠流畅表达消失。

思考问题

  1. 模型正确回答一个事实时,为什么不能立刻判断它是记忆还是泛化?
  2. 线性探针准确率很高,为什么仍不足以证明模型用该信息作出答案?
  3. 什么样的指标会把平滑概率变化显示成突然涌现?
  4. 模型给出的自然语言解释为什么应被视为待验证假设?

延伸阅读

参考文献

Carlini, Nicholas, Florian Tram‘er, Eric Wallace, 等. 2021年. 《Extracting Training Data from Large Language Models》. 30th USENIX Security Symposium, 2633~50. https://www.usenix.org/conference/usenixsecurity21/presentation/carlini-extracting.
Ji, Ziwei, Nayeon Lee, Rita Frieske, 等. 2023年. 《Survey of Hallucination in Natural Language Generation》. ACM Computing Surveys 55 (12): 1~38. https://doi.org/10.1145/3571730.
Meng, Kevin, David Bau, Alex Andonian, 和 Yonatan Belinkov. 2022年. 《Locating and Editing Factual Associations in GPT. Advances in Neural Information Processing Systems 35, 17359~72.
Olsson, Catherine, Nelson Elhage, Neel Nanda, 等. 2022年. 《In-Context Learning and Induction Heads》. Transformer Circuits Thread, 网络首发. https://doi.org/10.48550/arXiv.2209.11895.
Petroni, Fabio, Tim Rockt"aschel, Sebastian Riedel, 等. 2019年. 《Language Models as Knowledge Bases?》 Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing, 2463~73. https://doi.org/10.18653/v1/D19-1250.
Schaeffer, Rylan, Brando Miranda, 和 Sanmi Koyejo. 2023年. 《Are Emergent Abilities of Large Language Models a Mirage?》 Advances in Neural Information Processing Systems 36.
Wei, Jason, Yi Tay, Rishi Bommasani, 等. 2022年. 《Emergent Abilities of Large Language Models》. Transactions on Machine Learning Research. https://openreview.net/forum?id=yzkSU5zdwD.