术语表
本术语表给出全书采用的统一名称。括号中的英文便于查阅论文和技术文档;“系统说明”指正文中第一次集中解释该概念的位置,而不一定是它第一次出现的位置。遇到同一个中文词在不同语境中含义不同的情况,条目会明确指出不要混淆的对象。
基础构件
程序(program):用某种形式明确写下、可由计算机执行的一组指令。程序可以完全由人编写,也可以调用学习得到的模型;它不等于模型本身。系统说明:第 3 章。
算法(algorithm):解决一类问题的有限、明确步骤。搜索、排序和反向传播都是算法;一次具体运行产生的结果不是算法。系统说明:第 3 章和第 5 章。
模型(model):对数据规律、环境动态或任务关系的可计算表达。本书中的“学习模型”通常指由数据调整参数的系统;“世界模型”预测环境;“代理模型”则近似一个昂贵过程。三者作用不同,不要因为都叫模型就混为一谈。系统说明:第 8 章。
机器学习(machine learning):让系统从数据或交互经验中调整模型,而不是由人逐条写出全部规则的方法集合。机器学习是 AI 的重要路线,但不是 AI 的同义词。系统说明:第 8 章。
参数(parameter):训练过程中被调整、并在训练后保存于模型中的数值。参数会影响输出,却不能直接等同于一条事实或一段可读程序。系统说明:第 8 章和第 9 章。
Token(token):模型处理序列时使用的离散单位,可以是词、子词、字符、代码片段或其他符号。一个汉字不保证恰好对应一个 Token。系统说明:序章和第 20 章。
嵌入(embedding):把离散对象映射为连续向量的表示方式,使相似性和关系可以参与计算。嵌入是表示的一种,不等于对象的完整含义。系统说明:第 15 章。
表示(representation):系统内部用来编码输入、特征或关系的数值状态。表示中可被探针读出的信息,不一定被模型实际用于产生答案。系统说明:第 15 章和第 24 章。
学习与评测
训练(training):利用数据、目标函数和优化方法调整模型参数的过程。它不同于部署后仅使用固定参数计算输出的模型推理。系统说明:第 8 章。
模型推理(inference):给定输入和已训练参数,计算预测或生成结果的过程。这里的 inference 是运行模型,不应自动翻译成人类式的“推理能力”;概率统计中的 statistical inference 指依据数据推断未知量,又是另一种语境。系统说明:第 8 章和第 20 章。
推理过程(reasoning):为解决问题而组织中间步骤、搜索候选、检验约束或修正答案的过程。它可能发生在单次模型生成中,也可能由模型、搜索和验证器组成的系统完成。系统说明:第 26 章。
损失(loss):衡量模型输出与训练目标之间差异的数值函数。降低训练损失不保证真实世界中的可靠性、安全性或任务成功率同步提高。系统说明:第 8 章和第 9 章。
梯度(gradient):损失对一组参数的偏导数组成的向量,指出局部范围内各方向的变化率。梯度给出局部信息,不保证优化能找到全局最优解。系统说明:第 13 章。
泛化(generalization):模型在未参与训练、但属于目标任务范围的数据上仍保持有效表现的能力。泛化不是“见过相似样本”的另一种说法。系统说明:第 8 章。
过拟合(overfitting):模型过度贴合训练数据中的偶然细节,导致训练表现很好而新数据表现下降。参数多并不必然意味着已经过拟合,仍需看数据、正则化和评测证据。系统说明:第 8 章。
分布变化(distribution shift):部署时的数据、环境或任务分布与训练或评测时不同。它可能来自人群、时间、设备、行为反馈或任务定义变化。系统说明:第 8 章和第 31 章。
校准(calibration):在规定数据分布和分组方式下,模型给出的置信度与实际正确频率相匹配的程度。总体校准良好不代表每个子群体都校准良好。系统说明:第 10 章和第 31 章。
神经网络与基础模型
感知机(perceptron):根据输入的加权和进行二分类的线性模型,也是早期可学习神经元的重要形式。单层感知机不能解决线性不可分问题。系统说明:第 9 章。
反向传播(backpropagation):沿计算图反向应用链式法则,高效计算损失对各参数梯度的算法。它负责求梯度,参数如何更新则由优化算法决定。系统说明:第 13 章。
卷积神经网络(convolutional neural network, CNN):通过局部连接和参数共享处理网格数据的神经网络。卷积带来特定的结构偏置,但不保证模型自动获得对所有变化的稳健性。系统说明:第 14 章。
循环神经网络(recurrent neural network, RNN):按序列位置反复更新隐藏状态的神经网络。隐藏状态能够携带历史信息,却会受到容量和长程梯度传播的限制。系统说明:第 16 章。
注意力(attention):根据当前查询,为一组信息分配权重并汇总其内容的机制。注意力权重有助于分析数据流,但通常不能直接当作完整的因果解释。系统说明:第 19 章。
Transformer:主要依靠注意力、前馈网络、残差连接、归一化和位置表示处理序列的架构族。Transformer 是架构,不等于某个具体大模型。系统说明:第 20 章。
预训练(pretraining):先在大规模数据上学习通用表示或生成规律,再通过提示、微调或其他方式适配下游任务。预训练目标与最终使用目标通常并不完全相同。系统说明:第 21 章。
基础模型(foundation model):在广泛数据上训练、可适配多种下游任务的大规模模型。它描述模型在技术生态中的角色,不保证基础模型天然可靠或通用。系统说明:第 21 章。
生成与对齐
自回归生成(autoregressive generation):把联合概率分解为按顺序预测下一个 Token 的条件概率,并逐步生成序列。每一步的局部高概率选择不保证完整答案最优。系统说明:第 16 章和第 20 章。
扩散模型(diffusion model):学习逆转逐步加噪过程,从噪声中生成数据的模型族。实际系统常在压缩后的潜空间中扩散,并可能使用文本等条件控制。系统说明:第 22 章。
监督微调(supervised fine-tuning, SFT):用输入与目标回答配对的数据继续训练预训练模型,使其学习任务格式和示范行为。SFT 学到的是示范分布,不会自动覆盖所有冲突偏好和危险场景。系统说明:第 23 章。
基于人类反馈的强化学习(reinforcement learning from human feedback, RLHF):利用人类偏好训练奖励信号,再优化模型行为的一类流程。RLHF 不等于所有对齐方法,也不保证奖励模型准确代表人的真实意图。系统说明:第 23 章。
直接偏好优化(direct preference optimization, DPO):直接利用偏好对调整策略,使偏好回答相对不偏好回答更可能出现的方法。它省去显式训练并在线使用奖励模型的部分流程,但仍依赖偏好数据和参考策略等假设。系统说明:第 23 章。
对齐(alignment):让不同对象在规定关系上相互对应。多模态“表示对齐”让图文表示可比较;“行为对齐”让助手更符合指令与偏好;更广义的“AI 对齐”讨论系统目标、行为与人的价值和制度约束。三者不能互相替代。系统说明:第 23 章、第 25 章和第 32 章。
幻觉(hallucination):生成系统给出表面流畅、但缺少依据或与事实、输入、工具结果冲突的内容。幻觉是结果层面的现象,不应在未验证内部机制时解释成模型“故意撒谎”。系统说明:第 23 章和第 27 章。
系统能力
测试时计算(test-time compute):在回答或执行任务阶段投入的额外计算,例如生成多个候选、延长推理、搜索或验证。增加计算可能改善结果,但收益取决于候选多样性和验证质量。系统说明:第 26 章。
验证器(verifier):判断候选答案、步骤或状态是否满足某些条件的组件。验证器可以是规则、执行器、模型或人工流程;验证器本身也可能出错。系统说明:第 26 章。
检索(retrieval):从外部集合中找到与当前问题相关的项目。检索负责召回候选证据,不等于模型已正确理解、引用或使用这些证据。系统说明:第 27 章。
检索增强生成(retrieval-augmented generation, RAG):先检索外部材料,再把结果提供给生成模型的系统模式。RAG 的可靠性同时受索引、召回、排序、上下文组织、生成和引用约束影响。系统说明:第 27 章。
工具调用(tool use / tool calling):让模型选择并调用搜索、计算器、代码执行器、数据库或业务接口等外部工具。模型提出调用不等于调用已经成功,系统仍需校验参数、权限和返回结果。系统说明:第 27 章。
记忆(memory):跨步骤保存并再次利用信息的机制。“参数记忆”是训练后编码在参数中的统计规律;“上下文状态”是当前交互内可见的信息;“外部记忆”是可读写的数据库、文件或索引。它们的更新方式、容量和可信度不同。系统说明:第 27 章。
智能体(agent):在目标和约束下观察状态、选择行动、读取反馈并继续决策的系统。智能体通常由模型、工具、记忆、控制流程和权限边界共同组成,不应被简化成单一模型。系统说明:第 28 章。
闭环(closed loop):行动会改变环境,系统再根据新观察修正后续行动的循环。闭环的关键是反馈能够真正影响决策,而不只是预先生成一长串步骤。系统说明:第 28 章和第 29 章。
世界模型(world model):预测环境状态如何随行动变化,或压缩环境动态的模型。世界模型可以支持规划,却不代表系统已经拥有完整、准确的人类式世界理解。系统说明:第 18 章和第 29 章。
现实锚定(grounding):让符号、表示或生成内容通过感知、行动、测量和外部证据与现实对象及后果建立可检验联系。现实锚定不等于仅把更多文字放入上下文。系统说明:第 29 章和第 34 章。
边界与治理
基准(benchmark):按规定任务、样本、协议和评分方式比较系统的评测集合。一个基准分数只在这些条件内有意义,不等于对“智能”的完整测量。系统说明:第 31 章。
污染(contamination):训练、调参或选择过程中接触了评测题、答案或高度近似内容,使分数不能代表预期的未见样本能力。污染不同于模型通过一般知识正确作答。系统说明:第 31 章。
提示注入(prompt injection):攻击者把指令藏在用户输入、网页、文档或工具结果中,诱导系统偏离原目标或泄露信息。它是跨信任边界的系统安全问题,不能只靠一句更强的系统提示解决。系统说明:第 32 章。
最小权限(least privilege):只向组件授予完成当前任务必需的最少权限,并限制范围、时间和可传播性。模型能力强不构成扩大权限的理由。系统说明:第 32 章。
数据谱系(data lineage):记录数据从来源、授权、清洗、转换到训练和部署使用的流转关系。它帮助回答“数据从哪里来、经过什么处理、影响了什么”,但记录存在不保证授权本身合法。系统说明:第 32 章。
内容来源(content provenance):描述内容由谁、用什么工具、在何时如何产生和修改的可验证信息。来源凭证能支持追溯,不能单独证明内容真实。系统说明:第 33 章。
任务暴露(task exposure):一项工作中的具体任务在多大程度上可受 AI 影响。暴露度衡量技术可能触及的部分,不直接等于岗位会消失,也不包含采用成本和制度反应的全部影响。系统说明:第 33 章。
治理(governance):通过责任分工、规则、审计、监测、申诉和纠偏机制约束 AI 系统的开发与使用。治理不仅是发布前的一次审批,而是贯穿生命周期的持续过程。系统说明:第 32 章。
通用人工智能(artificial general intelligence, AGI):对跨任务广度、新任务适应、可靠性、自主完成能力、现实锚定和效率等提出较高要求的一组概念,而非已有唯一公认测试的固定产品类别。使用 AGI 一词时必须同时说明定义和证据标准。系统说明:第 34 章。