怎样判断一条 AI 新闻

“新模型达到博士水平。”

“AI 已经能独立完成软件工程。”

“这项技术将取代某个职业。”

这类标题未必是假的,却常常把一条有条件的实验结果压缩成一个没有边界的结论。论文测的是一组任务,产品展示的是一次运行,公司宣布的是一次发布,新闻标题却可能直接跳到“机器已经拥有某种普遍能力”。

判断 AI 新闻,不要求读者亲自训练模型,也不要求先成为统计学家。真正需要的是把一句宽泛的话重新展开:谁,在什么条件下,对什么任务,和谁相比,用什么证据,得到了多大改善,这个结果能推广到哪里?

本附录提供一套从几十秒到半小时都能使用的阅读方法。它不是“看到宣传就反对”,也不是“有论文就相信”,而是让结论与证据保持相称。

第一步:把标题改写成可检验的主张

标题常故意省略限制条件。遇到“最强”“超越人类”“会推理”“自主完成”时,先不要判断真假,把它改写成一个更完整的句子:

在日期 \(D\),系统 \(S\) 使用版本 \(V\),在运行条件 \(C\) 下,对任务集合 \(T\),按照指标 \(M\),相对基线 \(B\) 提高了 \(\Delta\);证据来自来源 \(E\)

这句话中的每一项都可能改变结论:

  • 日期 \(D\):网页、模型和排行榜会更新,旧结论可能不再适用;
  • 系统 \(S\):比较的是基础模型、带工具的系统,还是完整产品;
  • 版本 \(V\):同名产品背后可能已经更换模型;
  • 条件 \(C\):提示、工具、采样次数、时间、预算和人工帮助;
  • 任务 \(T\):公开考试、代码题、真实用户任务,还是精心挑选的演示;
  • 指标 \(M\):准确率、偏好胜率、首次成功率、成本或错误率;
  • 基线 \(B\):旧模型、专家、普通受试者,还是没有辅助的人;
  • 改善 \(\Delta\):绝对提高、相对提高,以及不确定性;
  • 来源 \(E\):公司公告、论文、独立复现,还是匿名转述。

若一条报道无法补全其中大部分内容,最稳妥的结论不是“它一定错了”,而是“现有信息不足以支持这个标题”。

提示三种不同回答
  • 结果属实:报告中的数字和条件可以核对。
  • 解释合理:这些数字确实支持报道给出的能力判断。
  • 能够推广:相同优势可能延伸到新用户、新任务和真实环境。

三者不是一回事。实验结果属实,不保证标题解释合理;标题在原任务上合理,也不保证能够推广。

先分清新闻说的是哪一层

AI 新闻中的“AI”可能指完全不同的对象。

论文提出了方法

论文主要回答:某个方法在规定实验中是否有效。它可能使用小数据集、受控环境和研究代码。论文被接收或放上预印本平台,表示它进入公开讨论,不等于已经通过所有复核。

模型展示了能力

模型是训练得到的参数与结构。一次模型评测通常不包括检索服务、工作流、权限、界面和人工复核。模型分数提高,不能直接推出完整产品同比例改善。

系统完成了任务

系统可能由模型、搜索、检索、代码执行器、验证器、记忆和规则共同组成。报告系统结果时,应说明各组件及其预算。把系统成绩全部归功于底层模型,会隐藏真正决定成功的工程条件。

产品向用户发布

产品发布说明可访问性发生变化,却不证明每项能力已经达到研究报告中的最好结果。产品还可能使用限流、路由、安全过滤和动态更新;同一个名称在不同时期不一定对应同一系统。

现实世界产生了影响

采用率、工作流程变化、事故、成本和制度反应属于部署证据。它们受组织、激励、培训、法规和用户行为共同影响,不能只由模型参数解释。

政策规定了责任或门槛

政策新闻说的是适用范围、生效时间、义务、例外和执行方式。提案、指南、技术标准、已经通过的法规和已经生效的规则,不属于同一种法律状态。

论文、模型、系统、产品、影响和政策可以互相关联,却不能互相替代。判断前先问“这条新闻究竟发生在哪一层”,能排除大量误读。

证据不是有或没有,而是有层级

以下层级不是机械排名,但能帮助判断一条结论目前有多稳。

1. 当事方陈述

公司公告、研究团队博客和产品说明最接近事件本身,适合确认“发布了什么、声称了什么”。它们也是利益相关方材料,通常不会主动突出最不利结果。

2. 精选示例或演示

演示能证明系统至少在某次条件下产生过某个结果,却不能给出典型成功率。失败尝试、提示调整、人工剪辑和后台工具若未披露,观看者无法知道示例的代表性。

3. 内部评测

开发者在一组基准或内部任务上报告结果,比单个示例更系统。仍需检查测试集选择、训练污染、基线设置、评分方式和是否只展示有利指标。

4. 可复查的论文与技术报告

方法、数据、协议和限制越透明,外部研究者越能审计结论。同行评审可以过滤一部分问题,但不是正确性的永久保证;预印本也不能仅因“尚未评审”就被自动判错。

5. 独立复现与对抗测试

无直接利益关系的团队在相近条件下得到相近结果,会增强可信度。若只能使用封闭接口,外部测试至少应固定版本、记录时间并公开协议。

6. 多环境部署证据

真实用户、长期运行、不同机构和不同分布中的结果,最接近实际影响,也最容易受到混杂因素影响。部署研究应同时报告收益、失败、人工接管、成本和受影响群体。

证据层级越高,通常越慢出现。新发布当天只能得到公司材料并不奇怪;问题在于报道是否把“尚待验证”写成“已经证明”。

一张成绩表至少要拆成五部分

第 31 章把评测拆成目标构念、任务样本、运行协议、评分器和汇总方式。阅读新闻时,可以把这五项当作成绩表背后的说明书。

测量目标:到底想证明什么

同一组题可能同时依赖知识、阅读、格式遵循、搜索和猜测。基准名称含有“推理”“数学”或“常识”,不表示它只测这个能力。

最强结论不能超过测量目标。例如选择题高分可以支持“在这些选择题上表现好”,若要进一步支持“能在开放环境解决研究问题”,还需要新证据。

任务样本:这些题代表什么

要看题目数量、来源、语言、难度、时间和抽样方式。来自同一模板的十万道题,不一定比来自多种真实任务的一千道题覆盖更广。

还要问平均分是否掩盖分组差异。模型可能在英语、常见领域和短任务上很好,却在小语种、罕见病例或长流程上明显下降。

运行协议:模型获得了什么条件

至少记录:

  • 零样本还是给了示例;
  • 提示由谁设计,是否针对测试集反复调整;
  • 是否允许联网、检索、计算器或代码执行;
  • 一题生成一次还是生成许多候选再选择;
  • 是否使用验证器、人工反馈或重试;
  • Token、时间、费用和硬件预算是多少。

“同一道题”不等于“同一场比赛”。模型使用工具而人类不能查资料,或者模型生成一百次取最佳而基线只尝试一次,都需要在结论中明确。

评分器:谁决定答案正确

选择题有标准答案,代码题依赖测试套件,开放回答可能由人或另一个模型评分。评分器会漏掉它没有检查的错误。

模型评委可以降低成本,却可能偏爱更长、更自信或与自身风格相近的回答。(Zheng 等 2023年) 高风险或小幅差异应抽样人工复核,并报告评委分歧。

汇总方式:平均数隐藏了什么

总体平均分会隐藏失败类型、群体差异和极端后果。可信报告还应给出:

  • 样本量与置信区间;
  • 各难度、语言、来源和群体的结果;
  • 首次成功率与重试后成功率;
  • 最佳、平均和最差运行;
  • 延迟、费用、能耗或人工时间;
  • 典型失败案例及副作用。

HELM 等工作强调在统一条件下同时报告准确性、稳健性、公平性、校准和效率,而不是只追逐一个总分。(Liang 等 2023年)

“提高 50%”可能只是从 2% 到 3%

新闻常混用百分点变化相对变化。准确率从 40% 到 50%,是提高 10 个百分点,也是相对提高 25%:

\[ \frac{50\%-40\%}{40\%}=25\% \]

错误率从 10% 降到 5%,准确率只从 90% 升到 95%,却可以写成“错误减少 50%”。两种说法都可能正确,但传达的直觉不同。

样本量也很重要。有 \(n\) 个近似独立样本,答对 \(k\) 个,准确率为:

\[ \hat p=\frac{k}{n} \]

在相同的 2 个百分点差距下,20 道题与两万道题提供的证据强度完全不同。若题目来自同一模板,样本间还会相关,不能把每道题都当成独立证据。

看到小幅领先时,至少问:

  1. 多次运行后差距是否仍存在?
  2. 是否在同一批题上做配对比较?
  3. 置信区间是否重叠?
  4. 改变提示、顺序或随机种子后是否稳定?
  5. 实际收益是否值得增加的成本?

统计上可检测的差异,不一定在真实业务中重要;真实业务中重要的风险,也可能被平均分冲淡。

排行榜最容易隐藏比较条件

排行榜提供快速比较,但排名不是模型的永久属性。

同名分数未必同条件

一列可能使用官方提示,另一列使用社区优化提示;一个系统允许工具,另一个只调用模型;一个结果来自单次生成,另一个来自多数投票。若协议不同,名次不能直接解释为模型能力顺序。

最佳提交不等于典型表现

开发者可以多次试验并只提交最好结果。公开测试集被长期反复使用后,也会逐渐成为开发目标。排行榜越有影响力,围绕排行榜优化的激励越强。

小差距不等于稳定领先

用户问题分布、评委群体、模型版本和参赛者集合变化,都可能改变相对排名。报道“跃居第一”时,应注明榜单、日期、类别、样本量和差距。

分数提高不等于所有任务提高

平均名次可能由少数大幅进步项目推动,同时另一些能力退化。最好查看逐任务结果和失败样本,而不是只看综合分。

数据污染会让测试题变成复习题

公开基准、答案解析、代码仓库和用户讨论可能进入训练数据。如果模型见过题目、改写版本或同源模板,高分就不能完全代表对新问题的泛化。

污染证据也有强弱:

  • 找到训练语料中的逐字题目与答案,是直接证据;
  • 模型复现异常长的标准答案,是值得调查的信号;
  • 训练截止日期早于题目发布日期,只能降低部分风险;
  • “我们没有故意训练这些题”不能证明大规模语料中不存在它们;
  • 模型答对公开题目本身,也不能反过来证明它一定记住了答案。

比较可靠的做法包括使用训练截止日期之后产生的题目、隐藏测试集、按来源或时间拆分、检查近似重复,并限制提交次数。

当训练数据不公开时,报道应保留不确定性,而不是在“完全无污染”和“全靠背题”之间二选一。

演示视频能证明什么,不能证明什么

一段机器人整理桌面、智能体订票或模型实时对话的视频,最适合回答:

在所展示的环境和某次运行中,这个系统能否产生这样的行为?

它通常不能单独回答:

  • 成功率是多少;
  • 失败尝试是否被剪掉;
  • 环境是否为演示专门布置;
  • 是否有人在镜头外选择提示或接管;
  • 系统是否使用预先知道的物体、网页或路径;
  • 换一个用户、房间、口音或网站后是否仍有效;
  • 完成一次需要多少时间和成本。

演示仍然有价值。它能暴露交互速度、动作连贯性和系统形态,也能提出值得正式测试的假设。正确做法是把演示当作“存在性证据”,而不是自动当作“成功率证据”。

对于视频,还应检查是否为实时连续录像,是否标出加速、剪辑、模拟环境和人工干预。看不到失败不表示没有失败。

“人类水平”必须同时定义人和规则

“超过人类”至少需要补全:

  • 是普通参与者、受训人员、从业者平均值,还是顶尖专家;
  • 人类与系统能否使用相同工具和资料;
  • 双方时间、尝试次数和奖励是否相同;
  • 比较平均值、最佳个体还是最低通过线;
  • 人类样本有多少,来自哪些人群;
  • 任务是否本来就代表现实能力。

模型在研究生选择题上超过某组受试者平均分,可以是一项真实成绩,却不等于它具有研究生完成实验、发现问题、承担责任和长期协作的全部能力。

反过来,模型尚未“达到人类水平”也不表示它毫无用处。高速完成一个可验证子任务,可能已经改变工作流程。应讨论具体任务与责任配置,而不是把所有影响绑在一个总标签上。

“会推理”“理解了”和“出现 AGI”都需要操作定义

这些词不是禁用词,但必须说明证据标准。

“会推理”

可能表示:

  • 在某组需要多步计算的题上正确率提高;
  • 生成了看起来连贯的中间步骤;
  • 使用搜索、验证器或代码执行后得到正确答案;
  • 在新组合与干扰条件下仍保持稳定。

四种证据强度不同。正确答案不揭示内部过程;流畅步骤可能包含事后编造;系统搜索成功也不等于单次模型生成具有同样能力。参见第 26 章

“理解了”

需要说明指行为泛化、内部表示、因果使用,还是人类式主观理解。探针能从表示中读出信息,不保证模型实际使用了它。参见第 24 章

“出现 AGI”

应先给出通用性的定义:任务广度、新任务适应、可靠性、长程自主能力、现实锚定和资源效率分别达到什么门槛。若定义只是“在若干基准上超过平均人类”,结论只覆盖这些基准。参见第 34 章

把争议词换成可观察条件,不会消除所有争议,却能让不同立场真正讨论同一个问题。

系统能力要把工具、预算和人工算进去

现代 AI 结果常来自整个系统:

模型
  + 提示与上下文
  + 检索或搜索
  + 工具与执行环境
  + 验证器
  + 重试和候选选择
  + 人工确认
  = 最终任务结果

这些组件不是“作弊”,它们本来就是系统设计的一部分。问题是报道是否披露并公平比较。

若一个代码系统生成 100 个候选,再由测试挑出通过者,它展示的是“模型 + 采样 + 测试器 + 计算预算”的能力。指标 \(\operatorname{pass@}k\) 通常随 \(k\) 增大而上升,但用户付出的时间和算力也上升。

长任务还会累积错误。若每个关键步骤独立成功率为 \(p\),连续 \(n\) 步都成功的理想化概率是:

\[ P(\text{全部成功})=p^n \]

即使 \(p=0.95\),连续 20 步全部成功也只有:

\[ 0.95^{20}\approx 0.36 \]

真实步骤通常不独立,系统也可以检测、重试和恢复,因此这个公式不是实际预测;它只是说明单步高分不能直接代表长程可靠性。

智能体新闻还要检查权限、无关修改、失败检测、回滚和停止机制。完成任务但泄露数据、重复下单或破坏环境,不能算完整成功。参见第 28 章第 32 章

医疗、科学和高风险新闻要再多问一层

“AI 发现药物”“超过医生”“预测极端天气”常把技术指标与现实结果放在同一句话里。

预测不等于干预有效

模型能预测某种风险,不表示根据预测采取行动一定改善结果。行动可能有副作用,用户也可能改变行为。

回顾性数据不等于前瞻性部署

在历史数据上测试,无法完整模拟未来患者、设备、流程与人员变化。前瞻性研究、跨机构验证和真实工作流试验提供不同层级的证据。

替代指标不等于最终结果

分子对接分数、图像相似度和短期代理指标可以帮助筛选,却不等于药物已经安全有效、材料已经量产,或患者结局已经改善。

专家标签也可能不确定

医学影像、科学分类和政策判断可能没有唯一真值。应报告专家如何达成标签、分歧怎样处理,以及系统是否只学会某个机构的记录习惯。

高平均分不能抵消不可接受的失败

在高风险领域,应分别报告漏诊、误报、罕见情况、群体差异、校准、拒答与人工接管。部署责任不能因为模型平均分高就转移给最后操作它的人。

第 30 章区分候选生成、模拟预测、实验验证和真实发现;新闻也应保持这几层证据的距离。

社会影响新闻要区分能力、采用和结果

“AI 能完成某职业 40% 的任务”不等于“40% 的岗位将消失”。

中间至少隔着:

  1. 技术在实验条件下能否处理某类任务;
  2. 组织是否有数据、流程和预算采用;
  3. 使用后是替代任务、辅助人员,还是创造新任务;
  4. 生产率收益如何分配;
  5. 法律、责任、客户偏好和劳动力供给怎样反应;
  6. 更低成本是否反而扩大需求。

岗位由多种任务组成,任务也会随技术变化。研究中的“暴露度”通常表示技术可能触及的任务比例,不是失业概率。

阅读就业、教育和创作新闻时,还要检查研究测的是短期实验、企业实际采用、招聘变化,还是宏观统计。不同时间尺度不能直接拼成一条因果链。参见第 33 章

安全事故与政策新闻要核对时间和责任链

事故报道需要区分:

  • 模型生成了错误建议;
  • 产品把建议展示给用户;
  • 系统拥有执行权限并采取了行动;
  • 人工流程未能发现或阻止;
  • 组织在事故后怎样调查和修复。

只说“AI 导致”可能隐藏系统设计和管理责任;只说“用户误用”也可能忽略产品可预见的风险。

政策报道则至少核对:

  • 是草案、提案、已经通过,还是已经生效;
  • 适用于哪些地区、主体和系统;
  • 有哪些豁免、过渡期和技术门槛;
  • 谁负责执行,违反后有什么后果;
  • 原始条文与报道标题是否一致。

风险框架如 NIST AI RMF 强调把治理、测量和持续管理放进系统生命周期,而不是只在发布前打一次勾。(National Institute of Standards and Technology 2023年)

沿着引用链回到最接近事实的来源

常见传播链是:

原始数据或事件
  -> 论文 / 技术报告 / 法规
  -> 机构新闻稿
  -> 媒体报道
  -> 社交平台摘要
  -> 截图和转述

每经过一层,背景可能减少,措辞可能变强。核查时反向走:

  1. 找到报道所指的具体论文、报告、公告或条文;
  2. 核对标题中的数字是否真的出现;
  3. 阅读方法、实验设置、限制和附录,而不只看摘要;
  4. 查看是否有数据、代码、模型卡或系统卡;
  5. 查找独立复现、作者回应和已知失败;
  6. 记录版本与访问日期。

模型卡用于说明模型用途、评测、限制与风险,数据说明则帮助追踪数据来源和构建过程。(Mitchell 等 2019年; Gebru 等 2021年) 文档存在不保证系统可靠,但缺少关键文档会提高外部核查成本。

二手来源也不天然低质量。好的记者可能访谈多方、发现论文没有讨论的利益冲突和部署后果。关键是区分:哪些是原始结果,哪些是采访观点,哪些是报道者的综合判断。

三档速度:根据重要性决定查多深

30 秒:先防止被标题带走

快速问五个问题:

  1. 这是论文、模型、系统、产品、现实影响,还是政策?
  2. 主张对应的具体任务和指标是什么?
  3. 信息来自当事方还是独立测试?
  4. 标题是否把“可能”“在某基准上”删掉了?
  5. 这条信息会影响重要决定吗?

若只是一般兴趣,可以先把结论标为“待核查”,不必立即完成全部调查。

5 分钟:找到原始来源

补查:

  1. 原始报告的日期、版本和作者;
  2. 测试数据、基线与运行协议;
  3. 是否披露工具、重试、成本和人工帮助;
  4. 限制部分写了什么;
  5. 是否已有可信的独立意见。

五分钟通常足以发现标题与原文之间最明显的距离。

30 分钟以上:为重要决定做证据审计

若新闻会影响采购、教学、投资、医疗、政策或公开传播,应进一步:

  1. 阅读方法与附录,核对样本和统计;
  2. 检查污染、版本变化和比较公平性;
  3. 查找复现、失败案例和不同立场;
  4. 计算绝对变化、成本与任务级风险;
  5. 写下结论适用范围和仍未知的部分;
  6. 设定重新检查的日期。

不是每条新闻都值得半小时。核查投入应与决策后果相称。

示例一:“模型在诊断上超过医生”

先把标题展开:

系统 \(S\) 在某医院收集的 \(n\) 个病例上,根据标签规则 \(G\),以指标 \(M\) 与一组医生 \(B\) 比较。

接着检查:

  • 病例是历史回顾还是未来连续进入;
  • 医生是否获得完整病历、影像和同样时间;
  • 模型是否使用了医生看不到的结构化字段;
  • 标签来自最终病理、专家共识,还是已有诊断记录;
  • 是否按疾病、设备、医院与人群分组;
  • 测的是准确率、敏感度、特异度还是患者结局;
  • 模型如何进入真实流程,谁复核,失败时谁承担责任。

可能得到的谨慎结论是:

在这组回顾性病例和规定输入条件下,系统在指标 \(M\) 上高于参与研究的医生平均值;跨医院泛化、前瞻性工作流和患者结局仍待验证。

这不是削弱成果,而是准确保存成果。

示例二:“新模型解决了复杂推理”

先确认结果来自单次模型输出,还是“模型 + 搜索 + 验证器 + 多次采样”。

再检查:

  • 任务是否公开,答案是否可能进入训练;
  • 题目是真正新组合,还是熟悉模板换数字;
  • 最终答案正确时,中间步骤是否也可靠;
  • 换一种措辞或加入无关信息后是否稳定;
  • 使用了多少 Token、候选、工具和时间;
  • 评分器能否发现过程中的隐蔽错误;
  • 结果覆盖哪类推理,不覆盖哪类。

合理表述可能是:

在规定题集和计算预算下,该系统通过多候选搜索与验证提高了最终正确率;这支持特定任务上的系统级解题能力,不单独证明模型内部具有一般、可靠的人类式推理。

示例三:“智能体能独立完成 80% 的工作”

“工作”必须拆成任务。先问:

  • 80% 是任务数量、时间比例、经济价值,还是某个评分器的通过率;
  • 任务来自真实工作日志还是研究者设计;
  • 完成标准是否检查副作用和质量;
  • 是否允许人工澄清、审批和修复;
  • 首次成功率与重试后成功率分别是多少;
  • 平均每个任务花费多少时间、费用与监督;
  • 系统拥有什么权限,失败能否撤销;
  • 未完成的 20% 是否恰好包含最高风险部分。

如果研究只覆盖隔离环境中的短任务,结论不应直接变成“80% 的岗位可以无人化”。更合适的结论是:

在该隔离测试集、工具和权限条件下,系统达到 80% 的任务判定通过率;真实组织中的长程可靠性、异常处理、监督成本和责任边界尚未由这项结果测量。

给结论标上置信状态

核查不是只输出“真”或“假”。可以使用四种状态:

  • 已确认:原始来源与关键条件可核对,多方证据一致;
  • 初步支持:证据方向一致,但独立复现、样本或部署信息仍不足;
  • 存在争议:可信来源对方法、数据或解释有实质分歧;
  • 证据不足:找不到原始来源,或现有材料无法支持标题强度。

还可以把事实与预测分开:

事实:某系统在公开报告中取得分数 X。
解释:作者认为这反映能力 Y。
预测:报道推测它将在时间 Z 内改变行业 W。

事实可被直接核对;解释需要理论与对照;预测还依赖采用、竞争、制度和时间。不要因为第一句正确,就自动接受后两句。

建立一张可更新的新闻卡片

对重要新闻,可以保存:

标题:
事件日期:
核查日期:
对象与版本:
主张:
原始来源:
证据层级:
任务与样本:
运行协议:
基线与指标:
成本与系统组件:
已知限制:
独立证据:
当前置信状态:
最强可支持结论:
仍不能推出什么:
下次复核条件:

“下次复核条件”可以是独立测试发布、产品版本更新、法规正式生效或真实部署数据出现。这样,新证据到来时只需更新卡片,而不是每次从社交平台的情绪重新开始。

转发之前,再做一次强度检查

传播也会改变证据。转述时应保留:

  • 任务与范围限定;
  • 来源链接和日期;
  • 自己没有核实的部分;
  • 结果与作者解释的区别;
  • 重要成本、工具和失败条件。

不要只截取排行榜第一名而裁掉协议说明,也不要把“作者声称”改成“研究证明”。如果证据仍在发展,可以直接写“初步结果”“尚无独立复现”或“仅适用于该测试”。

内容来源标准可以帮助记录媒体由谁、用什么工具、何时生成和修改;它能支持追溯,却不能单独证明内容真实。(Coalition for Content Provenance and Authenticity 2025年) 来源可信与结论正确仍是两个问题。

一页检查表

遇到下一条 AI 新闻时,按顺序检查:

  1. 对象:论文、模型、系统、产品、部署影响,还是政策?
  2. 版本:名称、日期和实际版本是否明确?
  3. 主张:能否写成具体任务、条件、指标和比较对象?
  4. 来源:原始材料在哪里,谁有利益关系?
  5. 样本:数据从哪里来,规模、语言、时间和分组怎样?
  6. 污染:测试是否可能进入训练、调参或提示开发?
  7. 协议:是否使用工具、搜索、重试、验证器或人工帮助?
  8. 基线:比较双方条件是否一致,基线是否足够强?
  9. 指标:绝对变化是多少,样本与不确定性是否充分?
  10. 评分:标准答案、测试、人类或模型评委会漏掉什么?
  11. 成本:时间、Token、费用、能耗与监督成本是多少?
  12. 稳定性:换提示、随机种子、任务来源或环境后是否保持?
  13. 部署:权限、副作用、回滚、责任与受影响群体如何处理?
  14. 边界:这项证据最强能支持什么,不能推出什么?
  15. 状态:已确认、初步支持、存在争议,还是证据不足?

最后把标题改写成一句带条件的话。若改写后仍然令人兴奋,那项进展通常更值得关注;若所有重要信息都必须删掉,标题才显得惊人,那么真正值得研究的可能是传播方式,而不是模型能力。

参考文献

Coalition for Content Provenance and Authenticity. 2025年. C2PA Technical Specification, Version 2.2. Coalition for Content Provenance; Authenticity.
Gebru, Timnit, Jamie Morgenstern, Briana Vecchione, 等. 2021年. 《Datasheets for Datasets》. Communications of the ACM 64 (12): 86~92. https://doi.org/10.1145/3458723.
Liang, Percy, Rishi Bommasani, Tony Lee, 等. 2023年. 《Holistic Evaluation of Language Models》. Transactions on Machine Learning Research. https://arxiv.org/abs/2211.09110.
Mitchell, Margaret, Simone Wu, Andrew Zaldivar, 等. 2019年. 《Model Cards for Model Reporting》. Proceedings of the Conference on Fairness, Accountability, and Transparency, 220~29. https://doi.org/10.1145/3287560.3287596.
National Institute of Standards and Technology. 2023年. Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1. National Institute of Standards; Technology. https://doi.org/10.6028/NIST.AI.100-1.
Zheng, Lianmin, Wei-Lin Chiang, Ying Sheng, 等. 2023年. 《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》. Advances in Neural Information Processing Systems 36, Datasets and Benchmarks Track. https://arxiv.org/abs/2306.05685.