第31章 如何测量 AI,又为什么会测错

一个模型在考试题上得到 90 分,我们很自然地想问:它是否已经达到人类水平?

这个问题听起来简单,其实把许多不同判断挤在了一起。题目是否代表真实任务?训练时是否见过相同内容?评分标准是否可靠?比较的是普通人、专家还是答题者平均值?模型用了多少次尝试、多少工具和多少费用?换一种表达,结果还稳定吗?

测量 AI 不是给模型找一张试卷,而是建立一条从能力定义、样本选择、运行条件到统计结论的证据链。排行榜可以提供重要信息,也可能制造一种虚假的精确感。

指标先要说明“测的是什么”

如果目标是判断垃圾邮件,准确率可能有意义;如果目标是辅助医生,漏诊与误诊的代价不同,只看准确率就不够;如果目标是完成软件任务,还要检查补丁副作用、成本和长期维护性。

任何评测至少包含五个部分:

  1. 目标构念:想测知识、推理、可靠性、速度还是任务完成能力;
  2. 任务样本:用哪些问题、用户、语言和环境代表这个构念;
  3. 运行协议:提示、工具、采样次数、时间和算力预算;
  4. 评分器:标准答案、测试程序、人类偏好或另一个模型;
  5. 汇总方式:平均分、分组结果、置信区间、成本和失败类型。
图 1: AI 评测依次把目标能力映射为任务样本,在明确运行协议下产生输出,再由评分器和汇总方法形成结论;任一环节失真都会削弱最终数字的含义。

其中任何一环变化,分数含义都可能变化。同名模型在零样本、少样本、思维提示、工具辅助和多次采样下,不是同一个评测条件。

基准把复杂能力压缩成可重复任务

MMLU 汇集多个学科的选择题,用于测量大规模多任务知识与理解。(Hendrycks 等 2021年) BIG-bench 由大量参与者构造多样任务,探索语言模型在不同能力上的表现和规模变化。(Srivastava 等 2023年) GPQA 则收集研究生层次、由领域专家编写并验证的问答,试图降低简单搜索即可作答的可能。(Rein 等 2024年)

这些基准的价值在于:题目、答案和协议相对明确,模型可以在相同条件下比较,研究者也能观察能力随方法变化的趋势。

但一组题只是目标能力的样本。选择题成绩可能同时依赖知识、语言理解、排除选项和测试技巧;它不直接测量提出研究问题、查证来源或在一个月后仍稳定完成工作的能力。

基准越流行,模型开发越会围绕它优化。久而久之,排行榜回答的可能是“谁最适应这套公开测试”,而不是“谁在所有相关任务上更好”。

核心机制:评测是从目标能力到可观察证据的映射

评测先定义要判断的能力,再从现实任务分布抽取样本,在固定运行协议下收集输出,由明确评分器产生指标。分数只支持这条链允许的结论;若样本不代表真实任务、训练数据污染测试集、评分器漏掉关键错误或运行预算不同,数字再精确也不能修复解释上的缺口。

“人类水平”必须先定义人和条件

一条新闻说模型超过了人类,至少还缺少以下信息:

  • 比较对象是随机路人、受过培训的答题者,还是领域专家;
  • 人类能否查资料、使用计算器或讨论,模型能否使用工具;
  • 双方获得多少时间,是否允许多次尝试;
  • 样本量多大,人类分数的不确定性如何;
  • 比较的是平均值、最佳个体,还是某个通过线;
  • 题目是否本来就是为人类考试设计的。

模型在某个选择题集合超过受试者平均分,是一个可报告结果,却不能推出“总体智能超过人类”。人类能力不是单一标尺,AI 能力也不是。

相反,“没有达到人类水平”也可能掩盖实际价值。一个系统即使不能独立完成整项工作,也可能高速处理其中可验证的子任务。正确问题不是贴一个总标签,而是明确任务、条件、错误代价和协作方式。

数据污染会把记忆伪装成泛化

公开题库、答案解析、代码仓库和讨论网页可能进入预训练数据。如果测试题或近似版本已经出现,模型高分可能部分来自记忆。

污染不只指逐字重复。题目改写、翻译、带答案的教程、同源代码和相同数据生成模板都可能泄漏。模型开发者若反复根据公开测试调整训练、提示或后处理,也形成面向测试集的间接过拟合。

可采用的防护包括:

  • 保留不公开的测试集并控制访问;
  • 使用在训练截止日期之后产生的任务;
  • 检查精确与近似重合、异常长串匹配和答案复现;
  • 按来源、时间、作者或项目拆分,而非随机拆分;
  • 限制提交次数,并用新样本持续轮换;
  • 同时报告公开集和真正盲测结果。

这些方法也不能证明绝对无污染。训练语料通常巨大且不完全公开,语义级重合很难穷尽。合理做法是报告排查范围与剩余不确定性,而不是宣称“已彻底排除”。

技术深潜:准确率、置信区间与配对比较

\(n\) 道题,模型答对 \(k\) 道,样本准确率为:

\[ \hat p=\frac{k}{n} \]

\(\hat p\) 是对某个任务分布上成功概率的估计,不是真值本身。若题目近似独立同分布,标准误差可粗略写为:

\[ \operatorname{SE}(\hat p)\approx\sqrt{\frac{\hat p(1-\hat p)}{n}} \]

样本越少,几分差距越可能只是抽样波动。题目若来自同一模板或文章,误差还会相关,简单公式会低估不确定性;应按题组重采样或使用与采样设计匹配的方法。

比较模型 A 与 B 时,最好在相同题目上做配对比较。定义每题差值 \(d_i=s_{Ai}-s_{Bi}\),关注:

\[ \bar d=\frac{1}{n}\sum_{i=1}^{n}d_i \]

这样能利用“同一道题对两个模型都难或都容易”的信息。只比较两个独立平均分,会丢掉配对结构。

运行协议也属于随机变量。生成模型更换采样种子可能得到不同答案;智能体还会受网页状态和工具延迟影响。应在足够多任务上重复运行,报告均值、区间、首次成功率和重试后成功率,而不是只保存一次最佳轨迹。

最后,统计显著不等于实践重要。提高 0.5 个百分点若需要十倍推理成本,是否值得取决于任务价值、延迟和错误后果。

单一准确率会藏起错误结构

HELM 提出从准确性、校准、稳健性、公平性、偏见、毒性和效率等多个维度评估语言模型,并强调统一场景和透明报告。(Liang 等 2023年) 这类框架提醒我们:同一个模型可以平均分更高,同时在某些群体、语言或风险场景更差。

以人脸相关分类为例,Gender Shades 对商业性别分类系统进行交叉群体分析,发现不同肤色与性别组之间存在显著准确率差异。(Buolamwini 和 Gebru 2018年) 总体准确率会被样本较多、较容易的群体主导。

因此应按与任务风险有关的维度分组:语言、地区、设备、年龄、专业、场景难度和时间。分组不能无限细到没有统计意义,也不能在看到结果后只挑最差或最好的一组。分组依据与最低样本量应尽量预先定义。

公平也不是一个指标能决定的。不同公平定义可能相互冲突,且模型误差只是整个决策过程的一部分。训练数据、阈值、人工复核、申诉机制和谁承担错误后果都需要进入评估。

幻觉要按任务与证据来测

“幻觉率”听起来像统一指标,实际至少包括:与输入材料矛盾、无法由来源支持、事实错误、错误引用、虚构实体和错误工具结果。综述工作展示了自然语言生成中多种幻觉定义与评测方法。(Ji 等 2023年)

封闭摘要任务可以逐句检查是否由给定文档支持;开放问答需要先确定可信来源与时间;创意写作则不应把虚构本身算成错误。

自动评分器可能再次引入模型偏差。让一个语言模型判断另一个模型的事实性很方便,却可能被流畅措辞说服,或不知道最新事实。高风险评测需要抽样人工核验、来源追踪和明确的“不确定/有争议”类别。

引用也不能只检查链接是否存在。还要检查来源是否真的支持相邻结论,结论是否超出论文条件,以及二手报道是否夸大原始研究。

校准问的是“置信度可不可信”

两个模型准确率都为 80%,一个在错误时仍声称 99% 确信,另一个能识别困难样本。后者更适合设置转交人工的阈值。

若模型对第 \(i\) 个二分类样本给出事件发生概率 \(p_i\),结果为 \(y_i\in\{0,1\}\),Brier 分数为:(Brier 1950年)

\[ \operatorname{BS}=\frac{1}{n}\sum_{i=1}^{n}(p_i-y_i)^2 \]

越小越好。可靠性图则把预测概率分箱,比较每箱平均置信度与实际正确率。现代神经网络即使准确率高,也可能没有良好校准;温度缩放等后处理可在验证分布上改善校准。(Guo 等 2017年)

语言模型的“我有 90% 把握”不是天然概率。它可能受提示方式、措辞和对话角色影响。应使用定义清楚的概率提取方式,并在独立样本上检验这些数字与频率是否匹配。

校准也不是永久属性。训练分布内的可靠概率,在新医院、新语言或新年份可能失效。

技术深潜:风险、拒答与选择性预测

训练数据来自分布 \(P_{train}(x,y)\),部署数据来自 \(P_{deploy}(x,y)\)。若两者不同,训练与验证得到的误差:

\[ R_{train}=\mathbb E_{P_{train}}[\ell(f(x),y)] \]

不能直接代表部署风险:

\[ R_{deploy}=\mathbb E_{P_{deploy}}[\ell(f(x),y)] \]

变化可能来自输入比例、标签规则、用户行为或问题机制。Ovadia 等人的研究显示,多种预测不确定性方法在数据集变化下会退化,且变化越大,校准通常越差。(Ovadia 等 2019年)

系统可以在置信度低时拒答或转交人工。设接受函数 \(g(x)\in\{0,1\}\),覆盖率为:

\[ C=\Pr(g(x)=1) \]

选择性风险只在被接受样本上计算:

\[ R_{sel}=\mathbb E[\ell(f(x),y)\mid g(x)=1] \]

提高拒答阈值通常降低覆盖率并可能降低错误,但前提是置信度真的能排序风险。若模型对分布外样本过度自信,系统会接受最需要拒绝的输入。

评测因此要画覆盖率 - 风险曲线,并单独测试时间变化、噪声、对抗改写、新来源和罕见群体。还要统计拒答是否集中在某些用户身上,以及人工队列能否承受转交量。

模型的自然语言解释或自我评价可以帮助定位候选问题,却不证明它知道自己的真实错误概率,也不揭示真实内部推理过程。可靠置信度必须由外部结果校准。

代码评测展示了“验证器决定成绩”

HumanEval 使用函数说明和单元测试评估代码生成,并常用 pass@\(k\) 表示从多个候选中至少一个通过测试的机会。(Chen 等 2021年)

若按同一采样协议生成并测试 \(n\) 个候选,其中 \(c\) 个能通过,再从这 \(n\) 个候选中不放回抽取 \(k\) 个,且 \(1\le k\le n\),pass@\(k\) 的常用无偏估计形式为:

\[ \operatorname{pass@}k=1-\frac{\binom{n-c}{k}}{\binom{n}{k}} \]

pass@1 与 pass@100 代表不同使用场景和计算预算。只报告较大的 \(k\) 会把大量采样成本藏在一个高分里。

更重要的是,测试未覆盖的错误不会被计分。EvalPlus 为 HumanEval 等任务增加大量测试,发现一些原本“通过”的程序并不真正正确。(Liu 等 2023年) 这说明基准成绩同时测模型和测试套件的强度。

真实软件工程还需要读仓库、理解需求、修改多个文件并避免回归。上一章提到的 SWE-bench 更接近这个流程,但它同样受测试覆盖、环境版本和任务污染影响。(Jimenez 等 2024年)

人类偏好评测也有偏好

开放式回答没有唯一标准答案时,可以让人类两两比较。Chatbot Arena 通过用户对匿名模型回答的偏好建立相对排名;相关工作还研究了使用强语言模型充当评判者。(Zheng 等 2023年)

偏好评测能捕捉帮助程度、风格和整体体验,却容易受回答长度、措辞、自信程度、展示顺序和评委群体影响。用户自选问题也不代表所有应用任务。

模型评委更便宜、更一致,但可能偏爱与自身风格相似的回答,对位置、冗长和模型身份敏感。应校验它与多样化人类判断的一致性,交换回答顺序,隐藏身份,并对分歧样本人工检查。

排名是相对的:加入或移除参赛模型、用户分布变化、模型版本更新,都可能改变结果。小幅评分差异不应被解释成永久能力顺序。

长任务要测轨迹和副作用

单轮基准每题重新开始,长任务却会把早期错误带入后续状态。智能体完成任务的评估至少要记录:

  • 最终目标是否满足,以及哪些约束被违反;
  • 首次成功、重试后成功和重复运行方差;
  • 工具调用数、Token、时间、费用和峰值资源;
  • 人类确认、纠正和接管次数;
  • 对环境做了哪些无关修改;
  • 失败后能否检测、回滚和安全停止。

系统级测试还要覆盖模型之外的检索、权限、数据库、工具和界面。一个问答模型升级后,可能提高局部分数,却因为调用格式变化让完整系统更差。

真实任务评估最好在隔离、可重置环境中进行,并用任务结果而非模型自报“已完成”作为判据。部署后还需要持续监测,因为用户与环境会随系统上线而改变。

一份可信评测报告应回答什么

  1. 测量目标是什么,不包括什么?
  2. 数据从哪里来,如何抽样、去重和分组?
  3. 测试是否可能进入训练或开发流程?
  4. 模型版本、提示、工具、采样和预算是否固定?
  5. 评分器会漏掉哪些错误,是否经过独立核验?
  6. 是否报告置信区间、分组结果、成本和失败案例?
  7. 是否测试改写、时间变化和分布外输入?
  8. 结果能否复现,还是只展示最佳运行?
  9. 与人比较时,双方条件是否真正可比?
  10. 这个分数支持的最强结论是什么?

好的评测不是追求一个永不失效的总分,而是让结论的边界清楚到足以被复查。

学习路径:做一次小型评测审计

实践继续后置。可以选一个公开问答或代码任务,按以下路径建立评测:

  1. 写出想测的能力与明确不测的能力;
  2. 固定提示、温度、尝试次数、工具和最大成本;
  3. 检查题目来源、时间、重复与近似重合;
  4. 同时报告总体分数、难度分组和置信区间;
  5. 对题目做不改变含义的改写,测量答案稳定性;
  6. 要求模型输出概率,画可靠性图和覆盖率 - 风险曲线;
  7. 人工检查自动评分器判定的通过、失败和边界案例;
  8. 写一页“这次评测不能证明什么”。

代码任务可以先用原始测试,再加入边界输入和性质测试,观察分数如何改变。这会直接展示验证器强度如何决定“正确”。

本章小结

  • 基准把复杂能力映射为可重复样本、协议和评分器,分数只能支持这条映射允许的结论。
  • “人类水平”必须说明比较人群、工具、时间、尝试次数和统计不确定性。
  • 测试数据的原文、改写、同源样本或开发反馈进入训练,都会把记忆和过拟合伪装成泛化。
  • 总体准确率会隐藏群体、场景和错误代价差异;多维与分组评测不可缺少。
  • 校准衡量概率和实际频率是否匹配,但分布变化会同时损害准确率和置信度。
  • 代码测试、模型评委和人类偏好都是有限验证器,需要说明其偏差和漏检范围。
  • 长任务必须测完整轨迹、成本、人工介入、恢复和副作用,而不能接受模型自报完成。

思考问题

  1. 一个模型在公开考试题上超过考生平均分,为什么不能直接推出它能替代该领域专家?
  2. pass@100 提高而 pass@1 不变,说明能力、预算和用户体验分别发生了什么?
  3. 模型在验证集校准良好,为什么部署后仍可能自信地犯错?
  4. 如果排行榜本身成为研发目标,测试集会发生怎样的变化?

延伸阅读

参考文献

Brier, Glenn W. 1950年. 《Verification of Forecasts Expressed in Terms of Probability》. Monthly Weather Review 78 (1): 1~3. https://doi.org/10.1175/1520-0493(1950)078%3C0001:VOFEIT%3E2.0.CO;2.
Buolamwini, Joy, 和 Timnit Gebru. 2018年. 《Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification》. Proceedings of Machine Learning Research: Conference on Fairness, Accountability and Transparency 81: 77~91.
Chen, Mark, Jerry Tworek, Heewoo Jun, 等. 2021年. 《Evaluating Large Language Models Trained on Code》. arXiv preprint arXiv:2107.03374.
Guo, Chuan, Geoff Pleiss, Yu Sun, 和 Kilian Q. Weinberger. 2017年. 《On Calibration of Modern Neural Networks》. Proceedings of the 34th International Conference on Machine Learning. https://arxiv.org/abs/1706.04599.
Hendrycks, Dan, Collin Burns, Steven Basart, 等. 2021年. 《Measuring Massive Multitask Language Understanding》. 9th International Conference on Learning Representations. https://arxiv.org/abs/2009.03300.
Ji, Ziwei, Nayeon Lee, Rita Frieske, 等. 2023年. 《Survey of Hallucination in Natural Language Generation》. ACM Computing Surveys 55 (12): 1~38. https://doi.org/10.1145/3571730.
Jimenez, Carlos E., John Yang, Alexander Wettig, 等. 2024年. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?》 12th International Conference on Learning Representations. https://arxiv.org/abs/2310.06770.
Liang, Percy, Rishi Bommasani, Tony Lee, 等. 2023年. 《Holistic Evaluation of Language Models》. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.09110.
Liu, Jiawei, Chunqiu Steven Xia, Yuyao Wang, 和 Lingming Zhang. 2023年. 《Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation》. Advances in Neural Information Processing Systems 36. https://arxiv.org/abs/2305.01210.
Ovadia, Yaniv, Emily Fertig, Jie Ren, 等. 2019年. 《Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty under Dataset Shift》. Advances in Neural Information Processing Systems 32. https://arxiv.org/abs/1906.02530.
Rein, David, Betty Li Hou, Asa Cooper Stickland, 等. 2024年. GPQA: A Graduate-Level Google-Proof Q&A Benchmark》. Proceedings of the First Conference on Language Modeling. https://arxiv.org/abs/2311.12022.
Srivastava, Aarohi, Abhinav Rastogi, Abhishek Rao, 等. 2023年. 《Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models》. Transactions on Machine Learning Research. https://arxiv.org/abs/2206.04615.
Zheng, Lianmin, Wei-Lin Chiang, Ying Sheng, 等. 2023年. 《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》. Advances in Neural Information Processing Systems 36, Datasets and Benchmarks Track. https://arxiv.org/abs/2306.05685.