怎样判断一条 AI 新闻
“新模型达到博士水平。”
“AI 已经能独立完成软件工程。”
“这项技术将取代某个职业。”
这类标题未必是假的,却常常把一条有条件的实验结果压缩成一个没有边界的结论。论文测的是一组任务,产品展示的是一次运行,公司宣布的是一次发布,新闻标题却可能直接跳到“机器已经拥有某种普遍能力”。
判断 AI 新闻,不要求读者亲自训练模型,也不要求先成为统计学家。真正需要的是把一句宽泛的话重新展开:谁,在什么条件下,对什么任务,和谁相比,用什么证据,得到了多大改善,这个结果能推广到哪里?
本附录提供一套从几十秒到半小时都能使用的阅读方法。它不是“看到宣传就反对”,也不是“有论文就相信”,而是让结论与证据保持相称。
第一步:把标题改写成可检验的主张
标题常故意省略限制条件。遇到“最强”“超越人类”“会推理”“自主完成”时,先不要判断真假,把它改写成一个更完整的句子:
在日期 \(D\),系统 \(S\) 使用版本 \(V\),在运行条件 \(C\) 下,对任务集合 \(T\),按照指标 \(M\),相对基线 \(B\) 提高了 \(\Delta\);证据来自来源 \(E\)。
这句话中的每一项都可能改变结论:
- 日期 \(D\):网页、模型和排行榜会更新,旧结论可能不再适用;
- 系统 \(S\):比较的是基础模型、带工具的系统,还是完整产品;
- 版本 \(V\):同名产品背后可能已经更换模型;
- 条件 \(C\):提示、工具、采样次数、时间、预算和人工帮助;
- 任务 \(T\):公开考试、代码题、真实用户任务,还是精心挑选的演示;
- 指标 \(M\):准确率、偏好胜率、首次成功率、成本或错误率;
- 基线 \(B\):旧模型、专家、普通受试者,还是没有辅助的人;
- 改善 \(\Delta\):绝对提高、相对提高,以及不确定性;
- 来源 \(E\):公司公告、论文、独立复现,还是匿名转述。
若一条报道无法补全其中大部分内容,最稳妥的结论不是“它一定错了”,而是“现有信息不足以支持这个标题”。
- 结果属实:报告中的数字和条件可以核对。
- 解释合理:这些数字确实支持报道给出的能力判断。
- 能够推广:相同优势可能延伸到新用户、新任务和真实环境。
三者不是一回事。实验结果属实,不保证标题解释合理;标题在原任务上合理,也不保证能够推广。
先分清新闻说的是哪一层
AI 新闻中的“AI”可能指完全不同的对象。
论文提出了方法
论文主要回答:某个方法在规定实验中是否有效。它可能使用小数据集、受控环境和研究代码。论文被接收或放上预印本平台,表示它进入公开讨论,不等于已经通过所有复核。
模型展示了能力
模型是训练得到的参数与结构。一次模型评测通常不包括检索服务、工作流、权限、界面和人工复核。模型分数提高,不能直接推出完整产品同比例改善。
系统完成了任务
系统可能由模型、搜索、检索、代码执行器、验证器、记忆和规则共同组成。报告系统结果时,应说明各组件及其预算。把系统成绩全部归功于底层模型,会隐藏真正决定成功的工程条件。
产品向用户发布
产品发布说明可访问性发生变化,却不证明每项能力已经达到研究报告中的最好结果。产品还可能使用限流、路由、安全过滤和动态更新;同一个名称在不同时期不一定对应同一系统。
现实世界产生了影响
采用率、工作流程变化、事故、成本和制度反应属于部署证据。它们受组织、激励、培训、法规和用户行为共同影响,不能只由模型参数解释。
政策规定了责任或门槛
政策新闻说的是适用范围、生效时间、义务、例外和执行方式。提案、指南、技术标准、已经通过的法规和已经生效的规则,不属于同一种法律状态。
论文、模型、系统、产品、影响和政策可以互相关联,却不能互相替代。判断前先问“这条新闻究竟发生在哪一层”,能排除大量误读。
证据不是有或没有,而是有层级
以下层级不是机械排名,但能帮助判断一条结论目前有多稳。
1. 当事方陈述
公司公告、研究团队博客和产品说明最接近事件本身,适合确认“发布了什么、声称了什么”。它们也是利益相关方材料,通常不会主动突出最不利结果。
2. 精选示例或演示
演示能证明系统至少在某次条件下产生过某个结果,却不能给出典型成功率。失败尝试、提示调整、人工剪辑和后台工具若未披露,观看者无法知道示例的代表性。
3. 内部评测
开发者在一组基准或内部任务上报告结果,比单个示例更系统。仍需检查测试集选择、训练污染、基线设置、评分方式和是否只展示有利指标。
4. 可复查的论文与技术报告
方法、数据、协议和限制越透明,外部研究者越能审计结论。同行评审可以过滤一部分问题,但不是正确性的永久保证;预印本也不能仅因“尚未评审”就被自动判错。
5. 独立复现与对抗测试
无直接利益关系的团队在相近条件下得到相近结果,会增强可信度。若只能使用封闭接口,外部测试至少应固定版本、记录时间并公开协议。
6. 多环境部署证据
真实用户、长期运行、不同机构和不同分布中的结果,最接近实际影响,也最容易受到混杂因素影响。部署研究应同时报告收益、失败、人工接管、成本和受影响群体。
证据层级越高,通常越慢出现。新发布当天只能得到公司材料并不奇怪;问题在于报道是否把“尚待验证”写成“已经证明”。
一张成绩表至少要拆成五部分
第 31 章把评测拆成目标构念、任务样本、运行协议、评分器和汇总方式。阅读新闻时,可以把这五项当作成绩表背后的说明书。
测量目标:到底想证明什么
同一组题可能同时依赖知识、阅读、格式遵循、搜索和猜测。基准名称含有“推理”“数学”或“常识”,不表示它只测这个能力。
最强结论不能超过测量目标。例如选择题高分可以支持“在这些选择题上表现好”,若要进一步支持“能在开放环境解决研究问题”,还需要新证据。
任务样本:这些题代表什么
要看题目数量、来源、语言、难度、时间和抽样方式。来自同一模板的十万道题,不一定比来自多种真实任务的一千道题覆盖更广。
还要问平均分是否掩盖分组差异。模型可能在英语、常见领域和短任务上很好,却在小语种、罕见病例或长流程上明显下降。
运行协议:模型获得了什么条件
至少记录:
- 零样本还是给了示例;
- 提示由谁设计,是否针对测试集反复调整;
- 是否允许联网、检索、计算器或代码执行;
- 一题生成一次还是生成许多候选再选择;
- 是否使用验证器、人工反馈或重试;
- Token、时间、费用和硬件预算是多少。
“同一道题”不等于“同一场比赛”。模型使用工具而人类不能查资料,或者模型生成一百次取最佳而基线只尝试一次,都需要在结论中明确。
评分器:谁决定答案正确
选择题有标准答案,代码题依赖测试套件,开放回答可能由人或另一个模型评分。评分器会漏掉它没有检查的错误。
模型评委可以降低成本,却可能偏爱更长、更自信或与自身风格相近的回答。(Zheng 等 2023年) 高风险或小幅差异应抽样人工复核,并报告评委分歧。
汇总方式:平均数隐藏了什么
总体平均分会隐藏失败类型、群体差异和极端后果。可信报告还应给出:
- 样本量与置信区间;
- 各难度、语言、来源和群体的结果;
- 首次成功率与重试后成功率;
- 最佳、平均和最差运行;
- 延迟、费用、能耗或人工时间;
- 典型失败案例及副作用。
HELM 等工作强调在统一条件下同时报告准确性、稳健性、公平性、校准和效率,而不是只追逐一个总分。(Liang 等 2023年)
“提高 50%”可能只是从 2% 到 3%
新闻常混用百分点变化和相对变化。准确率从 40% 到 50%,是提高 10 个百分点,也是相对提高 25%:
\[ \frac{50\%-40\%}{40\%}=25\% \]
错误率从 10% 降到 5%,准确率只从 90% 升到 95%,却可以写成“错误减少 50%”。两种说法都可能正确,但传达的直觉不同。
样本量也很重要。有 \(n\) 个近似独立样本,答对 \(k\) 个,准确率为:
\[ \hat p=\frac{k}{n} \]
在相同的 2 个百分点差距下,20 道题与两万道题提供的证据强度完全不同。若题目来自同一模板,样本间还会相关,不能把每道题都当成独立证据。
看到小幅领先时,至少问:
- 多次运行后差距是否仍存在?
- 是否在同一批题上做配对比较?
- 置信区间是否重叠?
- 改变提示、顺序或随机种子后是否稳定?
- 实际收益是否值得增加的成本?
统计上可检测的差异,不一定在真实业务中重要;真实业务中重要的风险,也可能被平均分冲淡。
排行榜最容易隐藏比较条件
排行榜提供快速比较,但排名不是模型的永久属性。
同名分数未必同条件
一列可能使用官方提示,另一列使用社区优化提示;一个系统允许工具,另一个只调用模型;一个结果来自单次生成,另一个来自多数投票。若协议不同,名次不能直接解释为模型能力顺序。
最佳提交不等于典型表现
开发者可以多次试验并只提交最好结果。公开测试集被长期反复使用后,也会逐渐成为开发目标。排行榜越有影响力,围绕排行榜优化的激励越强。
小差距不等于稳定领先
用户问题分布、评委群体、模型版本和参赛者集合变化,都可能改变相对排名。报道“跃居第一”时,应注明榜单、日期、类别、样本量和差距。
分数提高不等于所有任务提高
平均名次可能由少数大幅进步项目推动,同时另一些能力退化。最好查看逐任务结果和失败样本,而不是只看综合分。
数据污染会让测试题变成复习题
公开基准、答案解析、代码仓库和用户讨论可能进入训练数据。如果模型见过题目、改写版本或同源模板,高分就不能完全代表对新问题的泛化。
污染证据也有强弱:
- 找到训练语料中的逐字题目与答案,是直接证据;
- 模型复现异常长的标准答案,是值得调查的信号;
- 训练截止日期早于题目发布日期,只能降低部分风险;
- “我们没有故意训练这些题”不能证明大规模语料中不存在它们;
- 模型答对公开题目本身,也不能反过来证明它一定记住了答案。
比较可靠的做法包括使用训练截止日期之后产生的题目、隐藏测试集、按来源或时间拆分、检查近似重复,并限制提交次数。
当训练数据不公开时,报道应保留不确定性,而不是在“完全无污染”和“全靠背题”之间二选一。
演示视频能证明什么,不能证明什么
一段机器人整理桌面、智能体订票或模型实时对话的视频,最适合回答:
在所展示的环境和某次运行中,这个系统能否产生这样的行为?
它通常不能单独回答:
- 成功率是多少;
- 失败尝试是否被剪掉;
- 环境是否为演示专门布置;
- 是否有人在镜头外选择提示或接管;
- 系统是否使用预先知道的物体、网页或路径;
- 换一个用户、房间、口音或网站后是否仍有效;
- 完成一次需要多少时间和成本。
演示仍然有价值。它能暴露交互速度、动作连贯性和系统形态,也能提出值得正式测试的假设。正确做法是把演示当作“存在性证据”,而不是自动当作“成功率证据”。
对于视频,还应检查是否为实时连续录像,是否标出加速、剪辑、模拟环境和人工干预。看不到失败不表示没有失败。
“人类水平”必须同时定义人和规则
“超过人类”至少需要补全:
- 是普通参与者、受训人员、从业者平均值,还是顶尖专家;
- 人类与系统能否使用相同工具和资料;
- 双方时间、尝试次数和奖励是否相同;
- 比较平均值、最佳个体还是最低通过线;
- 人类样本有多少,来自哪些人群;
- 任务是否本来就代表现实能力。
模型在研究生选择题上超过某组受试者平均分,可以是一项真实成绩,却不等于它具有研究生完成实验、发现问题、承担责任和长期协作的全部能力。
反过来,模型尚未“达到人类水平”也不表示它毫无用处。高速完成一个可验证子任务,可能已经改变工作流程。应讨论具体任务与责任配置,而不是把所有影响绑在一个总标签上。
“会推理”“理解了”和“出现 AGI”都需要操作定义
这些词不是禁用词,但必须说明证据标准。
“会推理”
可能表示:
- 在某组需要多步计算的题上正确率提高;
- 生成了看起来连贯的中间步骤;
- 使用搜索、验证器或代码执行后得到正确答案;
- 在新组合与干扰条件下仍保持稳定。
四种证据强度不同。正确答案不揭示内部过程;流畅步骤可能包含事后编造;系统搜索成功也不等于单次模型生成具有同样能力。参见第 26 章。
“理解了”
需要说明指行为泛化、内部表示、因果使用,还是人类式主观理解。探针能从表示中读出信息,不保证模型实际使用了它。参见第 24 章。
“出现 AGI”
应先给出通用性的定义:任务广度、新任务适应、可靠性、长程自主能力、现实锚定和资源效率分别达到什么门槛。若定义只是“在若干基准上超过平均人类”,结论只覆盖这些基准。参见第 34 章。
把争议词换成可观察条件,不会消除所有争议,却能让不同立场真正讨论同一个问题。
系统能力要把工具、预算和人工算进去
现代 AI 结果常来自整个系统:
模型
+ 提示与上下文
+ 检索或搜索
+ 工具与执行环境
+ 验证器
+ 重试和候选选择
+ 人工确认
= 最终任务结果
这些组件不是“作弊”,它们本来就是系统设计的一部分。问题是报道是否披露并公平比较。
若一个代码系统生成 100 个候选,再由测试挑出通过者,它展示的是“模型 + 采样 + 测试器 + 计算预算”的能力。指标 \(\operatorname{pass@}k\) 通常随 \(k\) 增大而上升,但用户付出的时间和算力也上升。
长任务还会累积错误。若每个关键步骤独立成功率为 \(p\),连续 \(n\) 步都成功的理想化概率是:
\[ P(\text{全部成功})=p^n \]
即使 \(p=0.95\),连续 20 步全部成功也只有:
\[ 0.95^{20}\approx 0.36 \]
真实步骤通常不独立,系统也可以检测、重试和恢复,因此这个公式不是实际预测;它只是说明单步高分不能直接代表长程可靠性。
智能体新闻还要检查权限、无关修改、失败检测、回滚和停止机制。完成任务但泄露数据、重复下单或破坏环境,不能算完整成功。参见第 28 章和第 32 章。
医疗、科学和高风险新闻要再多问一层
“AI 发现药物”“超过医生”“预测极端天气”常把技术指标与现实结果放在同一句话里。
预测不等于干预有效
模型能预测某种风险,不表示根据预测采取行动一定改善结果。行动可能有副作用,用户也可能改变行为。
回顾性数据不等于前瞻性部署
在历史数据上测试,无法完整模拟未来患者、设备、流程与人员变化。前瞻性研究、跨机构验证和真实工作流试验提供不同层级的证据。
替代指标不等于最终结果
分子对接分数、图像相似度和短期代理指标可以帮助筛选,却不等于药物已经安全有效、材料已经量产,或患者结局已经改善。
专家标签也可能不确定
医学影像、科学分类和政策判断可能没有唯一真值。应报告专家如何达成标签、分歧怎样处理,以及系统是否只学会某个机构的记录习惯。
高平均分不能抵消不可接受的失败
在高风险领域,应分别报告漏诊、误报、罕见情况、群体差异、校准、拒答与人工接管。部署责任不能因为模型平均分高就转移给最后操作它的人。
第 30 章区分候选生成、模拟预测、实验验证和真实发现;新闻也应保持这几层证据的距离。
社会影响新闻要区分能力、采用和结果
“AI 能完成某职业 40% 的任务”不等于“40% 的岗位将消失”。
中间至少隔着:
- 技术在实验条件下能否处理某类任务;
- 组织是否有数据、流程和预算采用;
- 使用后是替代任务、辅助人员,还是创造新任务;
- 生产率收益如何分配;
- 法律、责任、客户偏好和劳动力供给怎样反应;
- 更低成本是否反而扩大需求。
岗位由多种任务组成,任务也会随技术变化。研究中的“暴露度”通常表示技术可能触及的任务比例,不是失业概率。
阅读就业、教育和创作新闻时,还要检查研究测的是短期实验、企业实际采用、招聘变化,还是宏观统计。不同时间尺度不能直接拼成一条因果链。参见第 33 章。
安全事故与政策新闻要核对时间和责任链
事故报道需要区分:
- 模型生成了错误建议;
- 产品把建议展示给用户;
- 系统拥有执行权限并采取了行动;
- 人工流程未能发现或阻止;
- 组织在事故后怎样调查和修复。
只说“AI 导致”可能隐藏系统设计和管理责任;只说“用户误用”也可能忽略产品可预见的风险。
政策报道则至少核对:
- 是草案、提案、已经通过,还是已经生效;
- 适用于哪些地区、主体和系统;
- 有哪些豁免、过渡期和技术门槛;
- 谁负责执行,违反后有什么后果;
- 原始条文与报道标题是否一致。
风险框架如 NIST AI RMF 强调把治理、测量和持续管理放进系统生命周期,而不是只在发布前打一次勾。(National Institute of Standards and Technology 2023年)
沿着引用链回到最接近事实的来源
常见传播链是:
原始数据或事件
-> 论文 / 技术报告 / 法规
-> 机构新闻稿
-> 媒体报道
-> 社交平台摘要
-> 截图和转述
每经过一层,背景可能减少,措辞可能变强。核查时反向走:
- 找到报道所指的具体论文、报告、公告或条文;
- 核对标题中的数字是否真的出现;
- 阅读方法、实验设置、限制和附录,而不只看摘要;
- 查看是否有数据、代码、模型卡或系统卡;
- 查找独立复现、作者回应和已知失败;
- 记录版本与访问日期。
模型卡用于说明模型用途、评测、限制与风险,数据说明则帮助追踪数据来源和构建过程。(Mitchell 等 2019年; Gebru 等 2021年) 文档存在不保证系统可靠,但缺少关键文档会提高外部核查成本。
二手来源也不天然低质量。好的记者可能访谈多方、发现论文没有讨论的利益冲突和部署后果。关键是区分:哪些是原始结果,哪些是采访观点,哪些是报道者的综合判断。
三档速度:根据重要性决定查多深
30 秒:先防止被标题带走
快速问五个问题:
- 这是论文、模型、系统、产品、现实影响,还是政策?
- 主张对应的具体任务和指标是什么?
- 信息来自当事方还是独立测试?
- 标题是否把“可能”“在某基准上”删掉了?
- 这条信息会影响重要决定吗?
若只是一般兴趣,可以先把结论标为“待核查”,不必立即完成全部调查。
5 分钟:找到原始来源
补查:
- 原始报告的日期、版本和作者;
- 测试数据、基线与运行协议;
- 是否披露工具、重试、成本和人工帮助;
- 限制部分写了什么;
- 是否已有可信的独立意见。
五分钟通常足以发现标题与原文之间最明显的距离。
30 分钟以上:为重要决定做证据审计
若新闻会影响采购、教学、投资、医疗、政策或公开传播,应进一步:
- 阅读方法与附录,核对样本和统计;
- 检查污染、版本变化和比较公平性;
- 查找复现、失败案例和不同立场;
- 计算绝对变化、成本与任务级风险;
- 写下结论适用范围和仍未知的部分;
- 设定重新检查的日期。
不是每条新闻都值得半小时。核查投入应与决策后果相称。
示例一:“模型在诊断上超过医生”
先把标题展开:
系统 \(S\) 在某医院收集的 \(n\) 个病例上,根据标签规则 \(G\),以指标 \(M\) 与一组医生 \(B\) 比较。
接着检查:
- 病例是历史回顾还是未来连续进入;
- 医生是否获得完整病历、影像和同样时间;
- 模型是否使用了医生看不到的结构化字段;
- 标签来自最终病理、专家共识,还是已有诊断记录;
- 是否按疾病、设备、医院与人群分组;
- 测的是准确率、敏感度、特异度还是患者结局;
- 模型如何进入真实流程,谁复核,失败时谁承担责任。
可能得到的谨慎结论是:
在这组回顾性病例和规定输入条件下,系统在指标 \(M\) 上高于参与研究的医生平均值;跨医院泛化、前瞻性工作流和患者结局仍待验证。
这不是削弱成果,而是准确保存成果。
示例二:“新模型解决了复杂推理”
先确认结果来自单次模型输出,还是“模型 + 搜索 + 验证器 + 多次采样”。
再检查:
- 任务是否公开,答案是否可能进入训练;
- 题目是真正新组合,还是熟悉模板换数字;
- 最终答案正确时,中间步骤是否也可靠;
- 换一种措辞或加入无关信息后是否稳定;
- 使用了多少 Token、候选、工具和时间;
- 评分器能否发现过程中的隐蔽错误;
- 结果覆盖哪类推理,不覆盖哪类。
合理表述可能是:
在规定题集和计算预算下,该系统通过多候选搜索与验证提高了最终正确率;这支持特定任务上的系统级解题能力,不单独证明模型内部具有一般、可靠的人类式推理。
示例三:“智能体能独立完成 80% 的工作”
“工作”必须拆成任务。先问:
- 80% 是任务数量、时间比例、经济价值,还是某个评分器的通过率;
- 任务来自真实工作日志还是研究者设计;
- 完成标准是否检查副作用和质量;
- 是否允许人工澄清、审批和修复;
- 首次成功率与重试后成功率分别是多少;
- 平均每个任务花费多少时间、费用与监督;
- 系统拥有什么权限,失败能否撤销;
- 未完成的 20% 是否恰好包含最高风险部分。
如果研究只覆盖隔离环境中的短任务,结论不应直接变成“80% 的岗位可以无人化”。更合适的结论是:
在该隔离测试集、工具和权限条件下,系统达到 80% 的任务判定通过率;真实组织中的长程可靠性、异常处理、监督成本和责任边界尚未由这项结果测量。
给结论标上置信状态
核查不是只输出“真”或“假”。可以使用四种状态:
- 已确认:原始来源与关键条件可核对,多方证据一致;
- 初步支持:证据方向一致,但独立复现、样本或部署信息仍不足;
- 存在争议:可信来源对方法、数据或解释有实质分歧;
- 证据不足:找不到原始来源,或现有材料无法支持标题强度。
还可以把事实与预测分开:
事实:某系统在公开报告中取得分数 X。
解释:作者认为这反映能力 Y。
预测:报道推测它将在时间 Z 内改变行业 W。
事实可被直接核对;解释需要理论与对照;预测还依赖采用、竞争、制度和时间。不要因为第一句正确,就自动接受后两句。
建立一张可更新的新闻卡片
对重要新闻,可以保存:
标题:
事件日期:
核查日期:
对象与版本:
主张:
原始来源:
证据层级:
任务与样本:
运行协议:
基线与指标:
成本与系统组件:
已知限制:
独立证据:
当前置信状态:
最强可支持结论:
仍不能推出什么:
下次复核条件:
“下次复核条件”可以是独立测试发布、产品版本更新、法规正式生效或真实部署数据出现。这样,新证据到来时只需更新卡片,而不是每次从社交平台的情绪重新开始。
转发之前,再做一次强度检查
传播也会改变证据。转述时应保留:
- 任务与范围限定;
- 来源链接和日期;
- 自己没有核实的部分;
- 结果与作者解释的区别;
- 重要成本、工具和失败条件。
不要只截取排行榜第一名而裁掉协议说明,也不要把“作者声称”改成“研究证明”。如果证据仍在发展,可以直接写“初步结果”“尚无独立复现”或“仅适用于该测试”。
内容来源标准可以帮助记录媒体由谁、用什么工具、何时生成和修改;它能支持追溯,却不能单独证明内容真实。(Coalition for Content Provenance and Authenticity 2025年) 来源可信与结论正确仍是两个问题。
一页检查表
遇到下一条 AI 新闻时,按顺序检查:
- 对象:论文、模型、系统、产品、部署影响,还是政策?
- 版本:名称、日期和实际版本是否明确?
- 主张:能否写成具体任务、条件、指标和比较对象?
- 来源:原始材料在哪里,谁有利益关系?
- 样本:数据从哪里来,规模、语言、时间和分组怎样?
- 污染:测试是否可能进入训练、调参或提示开发?
- 协议:是否使用工具、搜索、重试、验证器或人工帮助?
- 基线:比较双方条件是否一致,基线是否足够强?
- 指标:绝对变化是多少,样本与不确定性是否充分?
- 评分:标准答案、测试、人类或模型评委会漏掉什么?
- 成本:时间、Token、费用、能耗与监督成本是多少?
- 稳定性:换提示、随机种子、任务来源或环境后是否保持?
- 部署:权限、副作用、回滚、责任与受影响群体如何处理?
- 边界:这项证据最强能支持什么,不能推出什么?
- 状态:已确认、初步支持、存在争议,还是证据不足?
最后把标题改写成一句带条件的话。若改写后仍然令人兴奋,那项进展通常更值得关注;若所有重要信息都必须删掉,标题才显得惊人,那么真正值得研究的可能是传播方式,而不是模型能力。