上一节我们用计数把样本空间里的结果数清楚,再计算一个事件占了多大比例。条件概率会在这一步上做一个看似很小、实际很关键的改动:新信息出现以后,我们不再看原来的整个样本空间,而只看仍然可能的那一部分。
掷骰子前,“掷出 6”的概率是 。如果骰子已经落地,有人告诉你“点数大于 4”,原来六种结果里只剩 5 和 6。现在再问“点数是 6”的概率,答案变成 。骰子没有变,6 也没有变,变化的是我们知道的信息,以及随之缩小的观察范围。
概率与统计最反直觉的地方,往往就在这里。检测对患病者很灵敏,不等于阳性者大多患病;两件事不能同时发生,不等于它们互不影响;连续抽取看起来只是把同一个动作做两遍,但不放回时第二次的概率已经变了。本节会把这些容易混在一起的问题拆开,并用频数表、树图和自然频数三种方法反复核对。
遇到条件概率题,先别急着找公式。先用一句完整的话说出“已经知道什么”,再把它圈成新的样本空间。分母一旦选对,后面的式子通常会顺很多。
设 是我们关心的事件, 是已经知道发生的事件。知道 以后,落在 外面的结果都被排除了;在剩下的 中,只有 同时满足我们的目标。因此,只要 ,就有:
读作“在 发生的条件下, 发生的概率”。竖线右边是条件,也就是已经知道的信息;竖线左边才是要问的结果。
公式里最该盯住的是分母 。无条件概率 以整个样本空间为分母;条件概率 以事件 为分母。它不是在原概率上随便加一条信息,而是换了一批比较对象。

条件发生以后,条件之外的对象不再进入分母。右侧真正患病者所占的范围,才对应“患病给定阳性”。
掷一枚公平六面骰子,设:
原样本空间是 。知道 发生后,新范围只剩 ,其中符合 的只有 6,所以:
也可以从定义核对:
于是:
这里有一个很有用的检查:条件发生后,所有仍然可能的结果,其条件概率加起来必须是 1。5 和 6 各占 ,正好合计为 1。
条件概率并不保证变大。新信息可能让一个事件更可能、没变化,也可能直接变成不可能。判断方向要看条件筛掉了哪些结果,不能只凭“知道得更多了”来猜。
假设某校调查了 200 名学生是否经常骑车上学,以及是否参加体育社团,结果如下。
如果随机选一名学生,无条件地问“他经常骑车上学吗”,分母是全体 200 人:
如果已经知道他参加体育社团,分母就换成参加社团的 80 人,其中 42 人经常骑车:
反过来问“已知经常骑车,他参加体育社团的概率”,分母又换成经常骑车的 60 人:
两个问题都用到了同一个交叉格 42,但分母一个是 80,一个是 60,所以答案不同。这正是 和 不能随意互换的最直观原因。
把条件概率定义移项,就得到一般乘法公式:
同一个交集也可以换一种先后顺序:
这两个式子没有说 一定先在时间上发生。它们表达的是两种计算路线:先走到 ,再从 中走到 ;或者先走到 ,再从 中走到 。无论从哪一边进入,最后落到的都是 。
袋中有 5 个红球、3 个蓝球和 2 个橙球,共 10 个球。连续抽两次,每次随机抽 1 个,第一次抽出的球不放回。求两次都是蓝球的概率。
第一次抽到蓝球的概率是 。这一步还没有附加条件,因为袋中仍是最初的 10 个球。
已知第一次抽到了蓝球,袋中只剩 9 个球,其中蓝球只剩 2 个。所以第二次再抽到蓝球的条件概率是 ,不是 。
如果第一次抽完放回,第二次的蓝球比例仍是 ,两次都蓝的概率会变成:
不放回时答案是 ,放回时答案是 。差别不是计算技巧造成的,而是抽样机制变了:不放回会改变袋中组成,放回则让每一次面对相同的概率。
如果要同时发生三个事件,思路不变:
继续扩展到更多步,就是“第一步概率 × 已知前面都发生后的第二步概率 × 已知前面都发生后的第三步概率……”。树图上的一条完整路径,正是这条规则的图形版本。
树图里写在分支上的数通常是条件概率,走完整条路径得到的才是联合概率。把“一段分支的概率”和“整条路径的概率”混在一起,是树图题最常见的错误之一。
现在回到最容易让人产生错觉的例子。
某病在人群中的患病率是 。一种检测的敏感度是 ,特异度也是 。某人检测为阳性,他真正患病的概率是多少?
很多人第一反应是 。这个回答很自然,却答错了方向。
这两个条件概率共享“患病且阳性”这批人,但观察范围完全不同。一个以患病者为分母,一个以阳性者为分母。
敏感度关心患病者这一行:
特异度关心未患病者这一行:
而阳性预测值关心阳性这一列:
所以,敏感度和特异度描述的是“已知真实状态,检测表现如何”;阳性预测值描述的是“已知检测结果,真实状态如何”。它们回答的不是同一个问题。
概率一旦绕口,最稳妥的办法常常不是继续盯着小数,而是假想检查 10000 人。
患病率为 ,所以 10000 人中有 100 人患病,9900 人未患病。
敏感度为 。100 名患病者中有 95 人测出阳性,这 95 人是真阳性;另外 5 人是假阴性。
特异度为 。9900 名未患病者中有 9405 人测出阴性;剩余 ,也就是 495 人,被误判为阳性。
结果确实反直觉:一项敏感度和特异度都达到 的检测,阳性预测值却只有约 。原因不在检测失灵,而在基础率很低。未患病者有 9900 人,人数太多;即使只误伤其中 ,也会产生 495 个假阳性,远多于 95 个真阳性。
把 直接当成 ,叫作条件方向倒置。忽略患病率这个起点,则会落入基础比率谬误。检测结果是证据,但证据必须和事件原本有多常见一起解释。
同样的 10000 人可以整理成二维表:
从表里读敏感度,要固定“患病”这一行:
读特异度,要固定“未患病”这一行:
读阳性预测值,要改看“检测阳性”这一列:
频数表特别适合防止方向读反。看到条件,就找到对应的行或列;那个合计数就是分母。
把随机抽到的人先分为“患病”和“未患病”,再分别分出阳性与阴性。树上的两条阳性路径是:
两条阳性路径汇合,所以阳性的总概率是:
现在只在阳性路径里看“患病且阳性”占多少:
三种方法得到同一个答案。自然频数最容易建立直觉,频数表最方便查分母,树图最适合展示先分组、后观察结果的多阶段过程。它们不是三套互不相关的技巧,而是同一个概率结构的三种画法。
拖动上面的患病率、敏感度和特异度,可以观察阳性预测值怎样变化。尤其可以试试保持检测性能不变,只提高患病率:同一个阳性结果在高风险人群中通常更可信,因为真阳性路径在阳性人群里的占比提高了。
在这个例子中,阳性把患病概率从 提高到约 ,足足提高了十多倍。它当然提供了重要信息,只是还不足以单独当作确诊。现实判断往往会结合症状、风险因素和复检结果。
同理,阴性预测值回答的是 ,它也不是特异度。用表中的数据可得:
这里阴性结果非常令人安心,主要也是因为这种病本来就少见。换到患病率更高的人群,即使检测性能不变,阳性预测值和阴性预测值都会改变。
一个结果常常可以从多条互不重叠的路径到达。医学检测中的阳性,既可能来自患病者,也可能来自未患病者;下午下雨,既可能发生在多云的早晨之后,也可能发生在晴朗的早晨之后。
如果 互不重叠,而且合起来覆盖整个样本空间,那么任何事件 都可以按这些来源拆开:
只有两种来源 和 时,公式会变得很直观:
先沿每条路径相乘,算出各来源与目标事件同时发生的概率;再把通往目标事件的路径相加。这就是全概率公式。
某地早晨多云的概率是 ,早晨晴朗的概率是 。多云后下午下雨的概率是 ,晴朗后下午下雨的概率是 。求下午下雨的总概率。
多云且下雨是一条完整路径:
晴朗且下雨是另一条完整路径:
这类题里,“多云后下雨的 ”只是某一段分支;“多云且下雨的 ”才是一条完整路径;“下午下雨的 ”则是所有下雨路径的总和。三个数各自回答不同的问题。
全概率从“来源”走向“结果”;贝叶斯公式把问题转回来:已经看到结果 ,它最可能来自哪一条 路径?
对于来源 ,有:
这个长公式可以压缩成一句话:用某条解释路径的概率,除以所有解释路径的总概率。
分子 是“来源 且观察到 ”的联合概率;分母就是 ,由全概率公式算出。
沿用刚才的天气数据。现在已经知道下午下雨,求早晨多云的概率。
我们已经算出:
所以:
下午下雨这一证据把“早晨多云”的概率从先验的 推到了约 。原因并不神秘:多云路径比晴朗路径更容易产生下雨,看到雨以后,多云这条解释在所有解释中的占比自然上升。
先写清楚要反推的来源。不要只写“求概率”,而要明确写成 。
找到每个来源在看到证据前的概率,也就是更新的起点。医学检测里的患病率、邮件中的垃圾邮件比例,都属于这一步。
题目来源很少时,画树或写自然频数往往比死背长公式更不容易错。贝叶斯公式不是另一套新逻辑,它只是把“路径相乘、同类路径相加、目标路径除以总路径”合并成一行。
如果知道 发生以后, 的概率完全没变,就说 与 独立:
当相关概率为正时,下面几个判断彼此等价:
也就是说,独立是对称的。 没有改变 ,那么 也不会改变 。实际验算时只要选一条最方便的等式即可。
某活动中,随机选一名参与者。设 表示“报名摄影”, 表示“报名写作”。已知:
如果独立,应满足:
它恰好等于 ,所以在这组数据下,报名摄影和报名写作是独立事件。
注意,独立不表示两件事之间在语言上毫无关系,也不要求它们不能同时发生。这里恰恰有 的人同时报名两项。独立只是在说:知道一个报名结果,不会改变另一个报名结果的概率。
一般乘法公式是:
如果 与 独立,条件概率 就等于 ,于是简化为:
对相互独立的多个事件,也可以继续相乘:
例如公平硬币连续抛 5 次,每次结果互不影响,连续 5 次正面的概率是:
但别把“连续 5 次正面很少见”误读成“下一次更该出现反面”。已经发生的前 5 次不会改变第 6 次,下一次正面和反面仍各有 。把长期平衡误套到下一次试验上,就是常见的赌徒谬误。
这两个词都在描述事件之间的关系,但问的根本不是同一件事。
掷一次骰子,设 为“点数是 1”, 为“点数是 2”。它们互斥,因为一次不可能既掷出 1 又掷出 2。
可是它们绝不独立。原来 ;一旦知道 已发生, 就不可能发生:
从 直接降到 0,说明信息造成了最大的影响之一。
只要两个互斥事件本身都有正概率,它们就不可能独立。互斥不是“彼此没关系”,反而意味着其中一个发生会把另一个的概率压到 0。这个结论第一次看很反直觉,但只要用条件概率读一遍,就会发现它几乎是必然的。
再看独立事件。连续抛两枚公平硬币, 表示第一枚正面, 表示第二枚正面。两件事可以同时发生,而且:
所以它们独立。独立事件完全可以同时发生;互斥事件恰恰不能同时发生。用一句话记忆:互斥看交集是否为空,独立看条件是否改概率。
从一个小总体中不放回抽样,每抽走一个对象,剩余总体都会改变。这个改变也许很小,也许大到不能忽略。
还是看 10 个球的袋子。第一次抽到蓝球前,蓝球概率是 。如果第一次确实抽走一个蓝球,第二次蓝球概率变成 ;如果第一次抽走的是橙球,第二次蓝球概率反而变成 。第一步结果明确改变了第二步概率,所以两次抽取不独立。
一个班有 15 名学生,老师要随机点 3 名不同的学生回答问题。你一次都不被点到的概率是多少?
第一次点到别人的概率是 。
已知第一次没有点到你,还剩 14 名没被点过的学生,其中 13 人不是你。第二次仍没点到你的条件概率是 。
已知前两次都没点到你,第三次仍没点到你的条件概率是 。
如果老师每次点名后都允许再次点到同一个人,三次抽取相当于放回抽样,每次没点到你的概率都保持 :
两个结果很接近,但不是同一个模型。不放回时你最多被点一次;允许重复时你可能一次不被点,也可能被点多次。
如果总体很大,而抽出的比例很小,不放回造成的比例变化可能微乎其微。统计入门里常用一个经验判断:样本量不超过总体的大约 时,很多计算可以把不放回抽样近似看作独立。
这只是近似规则,不是突然恢复了严格独立。总体有 100000 人时抽走 1 人,下一次概率的变化通常很小;总体只有 10 人时抽走 1 人,组成变化就很明显。是否能近似,要看抽样比例和问题对误差的敏感程度。
“随机抽样”不自动等于“独立抽样”。随机只说明每次按照规定机制选择;是否独立还要看一次结果会不会改变下一次的概率。不放回抽样通常会带来依赖。
条件概率题的符号很多,但解题过程可以稳定在下面几步。
把问题翻译成一句话:已经知道什么,要问什么。把“已经知道”写在条件竖线右边,把“要问”写在左边。
判断题目给的是人数还是概率。有人数时先画二维频数表;多阶段概率时先画树;百分比很绕时,把它换成 1000 人或 10000 人的自然频数。
如果求“同时发生”,沿一条路径相乘;如果同一个结果来自多条互斥路径,把这些路径相加。
如果是看到结果后反推来源,用目标来源路径除以所有能产生该结果的路径总和。
与 一般不相等。把句子完整读出来,并标出“在谁当中”,比背符号更可靠。
罕见事件面对庞大的非事件人群时,少量假阳性也可能压过真阳性。先验概率不能省略。
只有独立时才能直接乘 。一般情形应该乘 ,不放回抽样尤其要更新第二步。
互斥事件一旦知道一个发生,另一个的概率就变成 0;对于正概率事件,这正好说明它们不独立。
某班 50 名学生中,20 人参加志愿服务,其中 14 人喜欢统计;30 人不参加志愿服务,其中 9 人喜欢统计。随机选一名学生,求:
某网站有 的访问来自手机端。在手机端访问中,有 的用户完成注册。随机抽取一次访问,求“来自手机端且完成注册”的概率。
某城市工作日堵车的概率是 ,不堵车的概率是 。堵车时一名学生迟到的概率是 ,不堵车时迟到的概率是 。求他当天迟到的总概率。
接着练习三。如果已经知道这名学生迟到了,求当天堵车的概率。
某病患病率为 。检测敏感度为 ,特异度为 。如果某人检测阳性,估计他真正患病的概率。
已知 ,,。判断 与 是否独立。
从一副标准扑克牌中随机抽 1 张。设 为“抽到红桃”, 为“抽到黑桃”。判断两事件是否互斥、是否独立。
袋中有 4 个白球和 6 个黑球。不放回连续抽 3 个球,求三个都是白球的概率。
这一节一直在追踪“患病或未患病”“阳性或阴性”“下雨或不下雨”这样的事件。条件概率让我们知道:信息出现后,事件的概率怎样更新;独立性让我们知道:什么时候新信息不会改变概率;不放回抽样则提醒我们:重复动作不一定是独立重复。
下一节会把这些结果进一步翻译成数字。例如把阳性记为 1、阴性记为 0,把三次抽样中的成功次数记成 。一旦随机结果被映射成数值,我们就能讨论随机变量的分布、期望和方差。这里学到的独立性与乘法规则,也会成为判断伯努利试验和二项分布是否适用的前提。
“两次都是蓝球”是一条完整路径,用一般乘法公式把两段相乘:
阳性人群不是只有 95 名真阳性,还包括 495 名假阳性,共有 590 人。因此:
阳性后的患病概率约为 。
两条路径互斥,而且覆盖了所有下雨的来源,所以把它们相加:
下午下雨的总概率是 。
对每个来源计算它产生该证据的路径概率,即“来源概率 × 该来源下证据出现的条件概率”。
把目标来源路径除以所有证据路径之和。答案必须落在 0 到 1 之间,而且证据越偏向某个来源,该来源的后验概率通常越高。
| 知道 后对 的影响 | 若 发生, 变为不可能 | 的概率保持不变 |
| 两个正概率事件能否同时满足 | 不能 | 可以 |
沿完整路径相乘:
最后做语义检查:分母是不是条件人群?答案是否在 0 到 1 之间?独立与互斥有没有被混用?不放回后分子分母是否随剩余对象变化?
两个概率使用同一个交叉人数 14,但条件不同,分母分别是 20 和 23。
已知迟到后,当天堵车的概率约为 。
阳性后的患病概率约为 。敏感度 不是这道题的直接答案,因为它的条件方向相反。
它与 不同,同样说明知道 后, 的概率发生了变化。
交集概率不等于边缘概率的乘积,因此它们不独立。知道抽到了红桃后,抽到黑桃的条件概率变成 0。
不能写成 ,因为题目是不放回抽样,三次抽取不独立。