第3章 概率统计:AI 的判断语言
这一章,我们终于要聊到 AI 最核心的"语言" - 概率。你可能早就注意到了:AI 很少给你"绝对正确"的答案,它给出的永远是可能性 - "这张图 95% 是猫""这句话 80% 是好评""下一步棋有 60% 的概率是最优的一步"。为什么 AI 总在说"可能"?因为现实世界本来就充满不确定性,而概率,就是人类发明出来描述不确定性的最好工具。这一章我们不推公式、不背定理,只做一件事:让你真正"感觉到"概率是什么。学完之后你会发现,AI 里那些吓人的名词 - 分布、期望、softmax、dropout - 其实都是你早就懂的道理,换了个名字而已。
3.1 概率:可能性有多大
先看你每天都会遇到的东西:天气预报。它从来不跟你说"明天一定下雨",它说的是"明天降水概率 70%"。这 70% 是什么意思?意思是:像明天这样的天气条件,历史上出现过 100 次,有 70 次真的下雨了。它不是说"明天有 70% 的时间在下雨",也不是说"有 70% 的可能下一场暴雨" - 它说的只有一件事:下雨这件事,有多大可能发生。
概率,就是用来描述"一件事有多可能发生"的数。它只有两条铁规矩,记住它们,你就掌握了概率的一半:
- 概率永远在 0 到 1 之间(写成百分比就是 0% 到 100%)。0 表示"绝不可能",1 表示"板上钉钉"。不会出现 1.5 的概率 - 就像不会有人说"有 120% 的可能性"。
- 所有可能情况的概率加起来一定等于 1。因为"总得发生点什么":掷骰子六个面的概率加起来正好是 1,因为总有一个面朝上。
把生活中的事情摆到标尺上,立刻就有感觉:
| 事件 | 概率 | 人话 |
|---|---|---|
| 太阳明天从东边升起 | 1 | 必然发生,板上钉钉 |
| 明天降水 | 0.7 | 十次里有七次会发生 |
| 抛硬币正面朝上 | 0.5 | 五五开 |
| 彩票中头奖 | 约 0.0000001 | 几乎不可能,但不是 0 |
概率还有一个可爱的性质:它描述的是"还没发生"时的不确定性。一旦事情真的发生了,概率就变成 0 或 1 - 要么发生了(1),要么没发生(0),没有中间态。我们说"今天降水概率 70%",是站在今天早上说的;到了晚上,雨要么下了,要么没下。
类比:概率不是"预言",是"不确定性的刻度"
概率不告诉你"明天一定会下雨",它只告诉你"不确定性有多大"。天气预报说 70%,是让你带伞的概率大一点、防晒的概率小一点 - 概率是帮你做决定的,不是替你做决定的。
一句话记住
概率 = 0 到 1 之间的一个数,衡量"一件事有多可能";0 是不可能,1 是必然,0.5 是五五开。所有可能情况的概率加起来必须等于 1。
3.2 条件概率:信息改变判断
做个思想实验。今天早上你出门前抬头看天:阴沉沉的。你心里快速估了一下:今天可能下雨,概率大概 60%。然后你掏出手机,看到一条推送:"今日午后有强对流天气,降雨概率 90%。"你立刻改主意:今天一定带伞。
发现没有?拿到新信息之后,你的判断变了。这就是条件概率 - 知道新信息之后,重新估计一件事的可能性。数学家把它写成 P(A|B),读作"在 B 已经发生的前提下,A 的概率"。那个竖线"|"就是"在……的条件下"的意思,它只是记号的方便,没有任何魔法。
用一个具体例子把它看穿。统计过去一年的 365 天:某天"下雨"的有 90 天,"带伞出门"的有 73 天,其中"下雨且带伞"的有 63 天。现在问:如果知道你今天带了伞,那么今天是下雨天的概率是多少?直觉告诉我们:不该再看全部 365 天了,而应该把目光收窄到"带伞的 73 天",数一数其中有多少天下雨 - 63 天。于是概率是 63 ÷ 73 ≈ 86%。你看,条件概率不过是"换了个圈子,重新算比例"而已。
\[ P(\text{下雨}\mid\text{带伞})=\frac{63}{73}\approx86\% \]
人话解释:条件概率就是"先换圈子、再算比例" - 知道"带伞"这个新信息后,我们只看带伞的 73 天(分母换成 73),再数其中下雨的 63 天(分子是 63),一除就得到更新后的判断。
你可能还听说过一个更"高级"的名字:贝叶斯。别慌,它只是把上面的直觉总结成了三步:先有一个初步估计(先验)→ 拿到证据 → 更新成修正后的估计(后验)。先验 → 证据 → 后验,就这三步,没有别的公式要背。为什么这个思想在 AI 里无处不在?因为 AI 判断事物,本质上就是不断"拿新证据更新旧判断" - 垃圾邮件过滤器一开始认为"这封邮件是垃圾"的概率不高(先验),看到"中奖""转账"这些词(证据),就把概率调高(后验),最后决定拦不拦。
体检单上的"阳性"不等于"得病"
体检某项指标呈阳性,得病的概率远不是 100% - 因为"阳性"这个证据本身也可能出错(假阳性)。贝叶斯思想提醒我们:证据会更新判断,但判断不能只依赖单一证据。这也是 AI 系统"不轻易下结论"的数学根源。
类比:侦探破案
侦探一开始对所有嫌疑人有个初步怀疑程度(先验);现场发现新线索(证据);于是重新分配怀疑程度(后验)。线索不会直接告诉你"凶手是谁",它只会让你调整对每个人的怀疑 - 条件概率做的就是这件事。
3.3 随机变量与分布
掷一颗骰子。在它落地之前,结果是不确定的:可能是 1,也可能是 6,而且每个数字的可能性一样大(都是 1/6)。像这样"结果不确定、但可能取值是明确数字"的东西,数学上叫随机变量。别被这个名词吓到,它就是一句话:一个会随机变化的数,我们关心它每个可能取值有多大可能。
把骰子的"取值"和"对应可能性"画成一张图 - 横轴是取值,竖轴是可能性,每根柱子的高度代表那个值出现的概率 - 你就得到了一张分布图。分布就是所有可能取值的"可能性地图":地图上哪块高,哪个值就更可能出现。下图左边是"公平骰子"的理论分布:六根柱子一样高(每根 1/6),加起来正好等于 1;右边是真实掷 600 次的结果,柱子高度会有一点点波动,但大致还是平的。
| 骰子取值 | 1 | 2 | 3 | 4 | 5 | 6 合 | 计 |
| 概率 | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 1 |
骰子的取值是 1 到 6 这六个整数,这种"取值像台阶一样一格一格"的随机变量叫离散随机变量。还有一种随机变量取值是连续的 - 比如身高,可以是 165.3 厘米、165.31 厘米……它没有一根根柱子,而是一条平滑的曲线,下一节我们就会见到最著名的连续分布。另外,这里藏着一个统计学的灵魂概念 - 大数定律:掷的次数越多,实际比例越贴近理论概率。掷 6 次可能六个面参差不齐,但掷 6 万次,每个面都无限接近 1/6。这就是为什么统计学家相信"数据多了,规律就显形" - 也是 AI 需要海量数据的原因之一。
给 AI 一张分布 = 给它一张世界地图
机器学习里,很多模型本质上都在"从数据里学一张分布":学完图片的分布,就能判断一张新图"像不像猫";学完语言的分布,就能接出下一个词。看到"分布"两个字,你就想"可能性的地图" - 一切就都顺了。
3.4 正态分布:宇宙的钟形曲线
量一量你们班 40 个人的身高,画一张直方图:把身高分成几个区间,数每个区间有几个人。你会看到一幅奇妙的画面 - 大多数人挤在中间(比如 165~175 厘米),特别高和特别矮的人很少,两边像滑梯一样对称地滑下去。这条"中间高、两边低、左右对称"的曲线,就是正态分布,也叫钟形曲线 - 因为它长得像一口钟。
正态分布是统计学的"顶流明星",因为它无处不在:身高、体重、考试成绩、测量误差、机器生产的螺丝直径……都近似服从正态分布。为什么?一个粗略但好用的直觉:当一个结果受很多很多个独立的小因素共同影响,而每个小因素只贡献一点点时,结果就会呈正态分布。身高就是这样 - 基因、营养、运动、睡眠……几百个小因素叠加,多数人"平平无奇"地落在中间,极端情况自然稀少。
正态分布只需要两个数就能完全描述:均值 μ(钟的中心,最高点在哪)和标准差 σ(钟的胖瘦)。σ 小,钟又高又瘦 - 大家都很接近均值;σ 大,钟又矮又胖 - 大家散得很开。更神奇的是,无论钟长什么样,68-95-99.7 法则永远成立:
用身高把它翻译成人话:假设全班平均身高 170 厘米、标准差 5 厘米,那么约 68% 的人身高在 165~175 厘米(μ±σ 内);约 95% 的人在 160~180 厘米(μ±2σ 内);约 99.7% 的人在 155~185 厘米(μ±3σ 内)。也就是说,几乎所有人都在均值三个标准差之内 - 超过这个范围的人,要么是姚明,要么是测量出错了。
| 范围 | 约包含多少 | 身高例子(均值 170、标准差 5) |
|---|---|---|
| μ ± σ | 约 68% | 165 ~ 175 厘米 |
| μ ± 2σ | 约 95% | 160 ~ 180 厘米 |
| μ ± 3σ | 约 99.7% | 155 ~ 185 厘米 |
类比:射箭高手
一个高手射靶,大多数箭落在靶心附近,偶尔偏一点,极少脱靶 - 箭的落点大致就是正态分布。这也解释了为什么 AI 和统计里总爱假设"误差服从正态分布":误差小的常见,误差大的罕见,这个假设让很多计算变得可行。
为什么到处都是正态分布
背后有个叫"中心极限定理"的大道理(名字吓人,直觉很简单):一堆独立的小因素叠加起来,结果就趋向正态。测量误差是无数小扰动叠加的,所以也服从正态 - 这是统计学的"万有引力"。
3.5 期望:平均的未来
假设街边有个游戏:花 2 块钱玩一次,有 1% 的机会赢 100 元,有 99% 的机会什么也得不到。你要不要玩?聪明的你会先算一笔账:平均每次玩,我能拿回多少钱?答案是 100 × 1% + 0 × 99% = 1 元。平均每次只拿回 1 元,却要花 2 元 - 不划算,不玩。
这个"平均每次能拿回多少",就是期望(expected value)。注意,它不是把所有结果加在一起除以个数那种简单平均,而是每个结果按它出现的可能性加权,再求和 - 可能性大的结果,在平均里占的份量就大。公式只有一个:
\[ \mathbb{E}[X]=\sum_i p_i x_i \]
人话解释:把每一种可能的结果 \(x_{i}\),乘以它发生的概率 \(p_{i}\),再把它们全部加起来。它回答的问题是:"如果我重复做这件事很多很多次,平均每次会得到什么?"
再举个例子。打游戏里的一个怪物:掉装备的概率 20%(值 100 元),掉金币的概率 30%(值 10 元),什么都不掉的概率 50%(值 0 元)。那么这个怪物平均每次给你多少?100×0.2 + 10×0.3 + 0×0.5 = 23 元。这 23 元就是打这个怪的"期望收益" - 游戏策划平衡数值,算的就是这种东西。下图把这三笔贡献画了出来:
类比:期望不是"最可能的结果"
掷骰子的期望是 1×1/6+2×1/6+…+6×1/6 = 3.5 - 但 3.5 这个数你永远掷不出来。期望不是"最可能的结果",而是"长期平均的结果"。就像"未来十年平均气温升高 1.5 度",不是说明天就热 1.5 度,而是长期趋势的平均。
提前认识一位老朋友
强化学习里,AI 智能体每一步都在追求"长期回报的期望"最大化 - 把所有可能结果的回报按概率加权平均,选期望最大的那条路。等你读主书第 6–7 章强化学习时,会再次遇见期望 - 到时候你会觉得它熟得不能再熟。
一句话记住
期望 = 概率加权的平均(E = Σ p·x)。它不预测单次结果,只回答"重复很多次后平均会怎样" - 做决策时,它比"运气最好的那种可能"靠谱得多。
3.6 从分数到概率:sigmoid 与 softmax
终于到了最"AI"的一节。想象 AI 要判断一张图片里是猫、狗还是鸟。在神经网络最后一层,模型给每个候选答案打一个分数(score):可能是 2.0、1.0、−0.5……这些分数能直接当概率用吗?不能。因为概率有两条规矩:必须在 0 到 1 之间、加起来必须等于 1。而分数可能是负数,也可能大于 1,加起来也不等于 1。
数学家发明了一个漂亮的转换器,叫 softmax("软"的最大值)。它干两件事:第一,把每个分数变成正数 - 用指数运算 \(e^{x}\),任何数的 \(e\) 次方都是正的;第二,把所有正数加起来当分母,让每个数除以总和 - 于是每个结果都落在 0 到 1 之间,加起来正好等于 1,一张货真价实的概率分布诞生了:
\[ P(i)=\frac{e^{x_i}}{\sum_j e^{x_j}} \]
人话解释:把每个分数取 \(e\) 次方(变成正数、顺便放大差距),再除以所有 \(e\) 次方的总和(归一化),就得到一组加起来等于 1 的概率。谁的原始分数高,谁分到的概率就大。
| 选 | 原始分数 | e 的分数次方 | softmax 概率 |
|---|---|---|---|
| 2.0 | 7.39 | 0.69(69%) | |
| 1.0 | 2.72 | 0.25(25%) | |
| −0.5 | 0.61 | 0.06(6%) |
如果只有两个选项(是/否、猫/狗二选一),还有一个更简单的转换器叫 sigmoid:它把任意一个分数压进 0 到 1 之间 - 分数越大,输出越接近 1。一句话记住:二选一用 sigmoid,多选一用 softmax。
交叉熵:错得离谱要重罚
AI 训练时天天用到交叉熵(cross entropy),它是一条"惩罚规则",直觉只有一句:预测错得越离谱,罚得越重。明明是一只猫,模型说"猫 99%" - 几乎不罚;模型说"狗 99%" - 错得离谱,重罚到让模型下次不敢再犯。AI 学习就是不断"犯错 → 被罚 → 调整",交叉熵就是那把量"错得多离谱"的尺子。至于"熵"是什么,暂时不用管 - 记住"离谱就重罚"就够了。
一句话记住
分数 ≠ 概率。softmax 负责"变正 + 放大差距 + 归一化",把分数变成加起来等于 1 的概率;二分类用 sigmoid,多分类用 softmax;交叉熵是"错得离谱要重罚"的惩罚规则。
3.7 随机性:AI 为什么需要"掷骰子"
讲到这里你可能会问:既然 AI 能算出每个选项的概率,那它每次都选概率最大的不就行了?为什么还需要随机性("掷骰子")?这是个好问题,答案藏在三个场景里。
第一,探索 vs 利用。想象你在陌生的城市找好吃的:总去那家吃过的老店,稳定但可能错过更好的(利用);偶尔冒险进一家新店,可能踩雷,也可能发现宝藏(探索)。AI 也一样 - 如果永远选当前看起来最好的,它可能永远发现不了更好的路。所以强化学习里的智能体,会在"按概率随机尝试"和"选当前最优"之间摇摆,这就是它"掷骰子"的第一个理由。
第二,Dropout:防止"偏科"。训练神经网络时,有个叫 dropout 的技巧:每轮训练随机"关掉"一部分神经元(比如 20%),逼着网络学会不依赖任何单个神经元。就像做小组作业时随机抽走一两个组员 - 逼着每个人都能独当一面,最后的小组反而更稳。关掉谁?靠随机。
第三,生成模型:要"多样",不要"复读机"。让 AI 写诗、续写小说时,如果每次都选概率最大的词,结果会非常无聊 - 翻来覆去都是那几个高频词。所以生成模型不选最大,而是按概率抽样:概率大的词更容易被抽到,但概率小的词偶尔也会被选中。这样 AI 写出来的句子才有变化、才像"人话"。下图展示了一次抽样:三个词的概率分别是 0.5、0.3、0.2,"骰子"落下时,大概率落在"猫",但也可能落在"鸟"。
类比:抽卡与摇号
概率大不是"一定",概率小不是"不可能"。手游抽卡、车牌摇号都是这个道理:SSR 概率 1%,不代表 100 次里必有 1 次,而是每一次都有 1% 的可能 - 随机性不会给你承诺,只会给你"倾向"。
本章要点
- 概率:0 到 1 之间的一个数,衡量"一件事有多可能";所有可能加起来 = 1。
- 条件概率:知道新信息后重新估计;先验 → 证据 → 后验,就是贝叶斯思想的全部直觉。
- 随机变量与分布:随机变量 = 会随机变化的数;分布 = 所有取值的"可能性地图",加起来等于 1。
- 正态分布:钟形曲线;均值 μ 定中心、标准差 σ 定胖瘦;68-95-99.7 法则。
- 期望:E = Σ p·x,概率加权的平均,回答"重复很多次后平均会怎样"。
- 分数 ≠ 概率:softmax 变正、放大差距、归一化;二分类用 sigmoid;交叉熵 = 错得离谱要重罚。
- AI 为什么随机:探索 vs 利用、dropout 防偏科、生成模型按概率抽样保多样性。
衔接 · 下一站
- softmax → 主书第 5 章 Transformer 的注意力:注意力权重就是把"查询和键的匹配分数"过一遍 softmax,得到对每个词的"关注度" - 加起来恰好是 1,和你这章见的概率分布一模一样。
- 交叉熵 → 主书第 1 章 BP 反向传播:神经网络的损失函数常选交叉熵,"错得离谱要重罚"的惩罚会沿着网络一层层传回去,驱动参数更新。
- 期望 → 主书第 6–7 章强化学习:智能体选动作的依据是"长期回报的期望" - 把每种可能结果的回报按概率加权平均,选期望最大的策略。
- 分布与数据 → 本书第 6 章:训练、验证、测试数据要"同分布"才有意义 - 模型从一张地图上学,却要在地图外的地方用,当然会翻车。
- 随机性 → 本书第 7 章:dropout 与采样是神经网络热身章里会动手遇到的第一个"随机",到时候你会知道它有多重要。






