上一章我们花了不少功夫数清楚结果:哪些有顺序,哪些没有;抽走的东西放不放回;为什么同样一句“随机选取”,可能对应不同的样本空间。现在,在原来的试验上加一句话,问题就变了。
比如,从一叠编号卡中抽一张,你原本关心它是不是红色。抽完以后,有人告诉你:“这张卡的编号是偶数。”卡没有重新抽,颜色也没有改变,但你判断它是红色的概率,可能已经变了。条件概率处理的,就是同一个试验里,知道更多信息以后,该怎样重新分配概率。
导论课里,你可能已经习惯了“已知什么,就在什么里面算”。这一章要把这句话落实成一个定义,再看看它为什么能推出乘法公式、全概率公式和 Bayes 公式。我们会始终追着同一个问题走:现在的分母,到底代表哪一批可能的结果?只要这件事说清楚,许多看起来反直觉的结论都会变得可以解释。
桌上有十张外形相同的卡片,编号从 到 ,每张被抽中的概率都是 。其中编号 的卡是红色,其余是蓝色。设 表示“抽到红卡”, 表示“抽到偶数卡”。
没有额外信息时,十张卡中四张红色,所以 。现在已知 发生,编号 的卡就都被排除了。留下来的五张是 ,其中红卡只有 两张。因此,在这个条件下,抽到红卡的概率是 。
这里刚好与原概率 相等,只是这组颜色安排造成的结果,并不意味着得到信息总会提高或降低概率。若红卡改成编号 ,已知偶数以后就只剩一张红卡,概率会降到 。若红卡改成 ,条件概率则升到 。信息怎样改变概率,取决于两个事件在原模型里的关系。
回到原来的四张红卡。计算中真正起作用的是两个集合:已知范围 有五张卡,目标在已知范围内的部分 有两张卡。于是
这个写法比“有利张数除以总张数”更一般,因为它用的是概率,可以继续处理那些结果不等可能、甚至无法逐个数出来的模型。
设 是同一个概率空间中的事件,并且 。我们定义
竖线右边的 是已经知道发生的事件;左边的 是接下来想问的事情。分子先去掉所有与 不相容的结果,分母再把留下来的概率总量重新缩放到 。
可以把它想成一次重新标尺。原来整个样本空间的概率是 ,而 只占 。既然我们现在确定落在 里面,就要把 这块整体当成新的 。因此,里面每一部分的原概率都要除以同一个 。它们之间的相对权重保留下来,总量变成了 。
想象一个只输出甲、乙、丙三种符号的装置,它们的概率分别是 。现在告诉你“输出不是丙”。剩下甲和乙两种可能,是否就各占一半?
不能这样算。原来乙出现的机会是甲的三倍,只排除丙,并没有理由抹掉这项差别。设 表示“不是丙”,则 ,所以
上一章关于等可能性的提醒,在这里仍然有效。条件概率缩小了讨论范围,却不会自动让这个范围中的所有结果等可能。 能用个数之比,是因为原来的有限模型等可能;一般情形要用概率之比。
使用区域演示时,先观察交集的变化,再比较两个方向的条件概率。它用均匀面积表达概率;不要把“在纸上画得同样大”当成所有模型中都成立的概率关系。若一个区域内概率分布不均匀,应比较该区域包含的概率总量。
条件概率的定义不是为了凑出几道应用题。固定一个正概率事件 后,把
看作一套新的概率,它仍然满足我们前面学过的概率公理。
先看非负性。,分母又为正,所以 。再看总量:
若 两两互斥,那么 也两两互斥。由原概率的可列可加性,
所以,之前证明过的补事件公式、单调性、加法公式,都可以搬到“已知 ”的世界中。比如
以及
这些公式有一个细节要守住:右边所有项都在同一个条件 下。不能把一项写成条件概率,另一项又偷偷换回原概率;那是在用两套标尺做同一次加减。
在同一群人里, 会使用工具甲, 会使用工具乙, 两种都会。随机选一人,已知他会乙,再问会甲的概率,是
反过来,已知会甲,再问会乙,得到
分子是同一批两种都会的人,分母却分别是“会乙的人”和“会甲的人”。所以两个方向不能交换。若 且交集概率也为正,它们相等恰好要求 ;若交集概率为零,两者都为零,也会相等。
同样要区分 与 。前者保持观察范围不动,改问目标是否不发生;后者更换了观察范围。只有前者直接等于 。
条件概率的竖线不是除号。 不能写成 ,也不能随意交换左右两边。先用一句完整的话说出“已知什么,问什么”,通常比急着代数值更可靠。
定义要求 。如果 ,那么 ,分子也只能是零,原公式会变成 ,没有定义。
这不意味着所有零概率事件都是不可能发生的。比如在长度为 的区间内均匀选一个点,每个指定单点的概率都是零,但结果当然会落在某个点上。问题在于,原来的概率之比已经不能回答“恰好知道落在这个点时”怎样条件化。
后面学习连续随机变量时,我们会通过联合分布、条件密度等工具处理这类问题。本章可以放心使用正概率事件作为条件;遇到零概率条件,不能擅自把答案设成零,也不能把一个未经说明的极限当成唯一答案。
连续样本空间本身并不妨碍本章公式使用。例如在 中均匀选一个位置,已知它落在 ,求它落在 的概率。条件区间长度为 ,目标与条件的交集长度为 ,所以
这里能按长度计算,是因为模型均匀;能用条件概率比值,是因为条件区间的概率 为正。两项理由各管一件事。
条件概率定义稍作整理,得到
如果 ,也可以先从 出发:
直观上,先有 这么大一部分结果落进 ;其中又有 这么大的比例同时满足 。把两层比例相乘,就回到整个样本空间中同时满足两件事的概率。
这个“先”是在安排计算顺序,不一定是时间顺序。已知一次抽样的总结果以后,我们也可以反过来求较早那一步的条件概率。交集 本身并不带时间方向。

盒中有五个白球、三个黑球,每次等可能地抽取一个,连续抽两次且不放回。设 分别表示第一、第二次抽到白球。我们要算的是“两次都白”,也就是 。
第一次抽白球的概率是 。如果第一步已经抽走一个白球,那么第二步面对的是四白三黑,所以 。于是
如果第一步抽到黑球,第二步的白球概率又会变成 。因此,概率树中“第二次白球”的两条分支数值不同,它们描述的是两个不同条件下的机会。
上一章可以直接按组合数求同一事件:
两种算法相遇了。组合数把整对球一次选出;条件概率把过程一步一步展开。前者适合只关心最终组合,后者适合追踪过程中发生了什么。
若改成抽完放回,并且每次重新等可能地抽取,第一步的颜色不会改变下一次盒中的组成。此时第二个分数仍是 ,两白概率变成 。我们还没有给“独立”下正式定义,但已经看到了它将要刻画的现象:有些信息会改变后续概率,有些不会。
有人见到“同时发生”,就写 。抽球例子已经说明这样会出错:两次都抽白的概率是 ,并非 。一般乘法公式中第二项是条件概率;把它换成无条件概率,需要另外证明相应的独立性。
事件发生在不同时间,也不能自动保证独立。第一步取走了什么会影响第二步,天气状况可能同时影响上午和下午的延误,装置状态可能连续影响多次测量。乘法公式始终能按条件展开,是否能去掉条件则是下一章的问题。
三个事件同时发生时,先把前两个看成一个事件,再使用乘法公式:
继续下去,得到链式乘法公式:
这里要求出现在条件位置的前缀交集都有正概率。若某条路径走到一半的概率已经为零,整条路径的概率就是零;不必再试图定义那个零概率节点后面的分支。
还用五白三黑的盒子,连续不放回抽三次,求顺序恰好为“白、黑、白”的概率。第一步是 ;已知第一步白,第二步黑的概率是 ;已知前两步白、黑,剩下四白两黑,第三步白的概率是 。因此
最后一项必须根据前两步共同留下的盒子组成来算。把 直接缩成 ,一般没有依据;“只记住上一刻就够了”是一种额外的模型性质。
乘法公式让我们会算一条路径。接下来常见的问题是:同一个结果可能由好几条不同路径产生,这些贡献怎样合并?
一家文具仓库的笔记本来自甲、乙、丙三个供货商,供货占比分别是 。某项装订检测在三个来源中的不合格率分别是 。从仓库全部笔记本中等可能地抽一本,它不合格的概率是多少?
不能直接把 做普通平均,因为三个来源在仓库中并不各占三分之一。我们得先问:随机拿到一本时,有多大概率走到这个来源,再问走到这个来源以后,有多大概率不合格。
设 表示不合格, 分别表示来自甲、乙、丙。三条路径的贡献是
一本笔记本只来自其中一家,所以这三种“不合格且来自某家”的情况不会重叠。把最后一列相加,得到
整体不合格率是 。这就是全概率公式在做的事:先按来源分组,在每组中算目标事件,再按来源所占比例合并。
现在把上面的结构写清楚。若 两两互斥,并且并集是 ,我们称它们构成样本空间的一个划分,也常称为完备事件组:
无论目标事件 是什么,都有
这个等式的理由很直接:每个属于 的结果一定在某个 中,所以不会漏;又最多在一个 中,所以不会重。交集块两两互斥,可加性就给出
如果各 ,再对每块用乘法公式,得到
若某块概率为零,它与 的交集概率也为零,可以从求和中略去。严谨地说,不是拿一个未定义的 与零相乘。对可数个互斥块,依靠可列可加性也有相同形式的无穷级数;本章多数计算只需要有限分块。

把人群分成“喜欢数学”“喜欢编程”,通常不能直接作为划分:有人两者都喜欢,也有人两者都不喜欢。可以改分成“只喜欢数学”“只喜欢编程”“两者都喜欢”“两者都不喜欢”四组,或者使用一个明确的单一分类标准。把来源列出来以后,应先检查每个对象是否恰好进入一组,再考虑代数值。
全概率公式中的权重 非负且总和为 ,因此 必须介于各组的条件概率最小值与最大值之间:
文具仓库的总体不合格率应在 与 之间。如果算出 ,通常是把各组不合格率直接相加了;如果算出负数,显然也不可能。这类检查不能替代推导,却能很快发现分母或权重出了问题。
还可以在纸上做一次对照:固定三家的不合格率,把供货权重改成 ,总体不合格率就变成 。没有任何一家质量变差,总体不合格率却从 升到了 ,原因是高不合格率来源占比增加。解释总体变化时,要分清混合比例变化和组内表现变化。
可以。假设除了来源,我们还知道抽到的笔记本属于某批促销库存,记这个条件为 ,并且 。此时讨论范围已经变成 ,所有权重和组内概率都应该在这个范围中计算:
只对 的项写出条件概率,零贡献的项略去。推导与刚才完全相同,只不过现在使用的是概率 。
为什么不能沿用原来供货占比?因为促销库存的来源结构可能与整个仓库不同。即使某供货商占全部库存的一半,它也未必占促销库存的一半。一旦题目添加了条件,分层权重本身也可能需要更新。
继续看那本文具仓库的笔记本。还没检测时,它来自丙供应商的概率是 。现在检测发现它不合格。这个信息会不会让我们更怀疑丙?
丙的不合格率最高,直觉上应该上升。但上升到多少,不能只看 。甲供货多,虽然不合格率较低,也会贡献一部分不合格品。我们真正要比较的是:所有不合格品中,有多少概率来自丙这条路径。
上面已经算出,来自丙且不合格的概率是 ,不合格总概率是 ,所以
它高于原来的 ,但远远不是 。同样地,甲、乙的后验概率分别为
三项加起来为 :观察到不合格以后,这三个来源仍然是不重不漏的全部可能。
设 是正概率事件构成的划分, 是我们观察到的证据,且 。由条件概率定义,
分子是一条路径,用乘法公式展开;分母是所有能产生证据的路径之和,用全概率公式展开:
这就是 Bayes 公式,也称贝叶斯公式。它里面的几个名称,分别对应一次更新的不同位置。
叫先验概率,表示在本次证据到来之前,我们在当前模型里对来源的判断。它不要求凭空猜测,可以来自抽样设计、已经掌握的数据,或此前更新得到的概率。
是在来源 成立时出现证据 的概率。把证据固定、比较不同来源时,这个量常称为该来源对证据的似然。它回答“如果真是这个来源,见到当前结果有多容易”,与“见到结果后这个来源有多可能”是两个方向。
叫后验概率。分母 将所有来源的路径贡献归一化,使各个后验概率相加为 。
“来源”也可以换成“候选解释”,但别直接把 Bayes 公式读成因果证明。一个事件出现后提高另一个事件的概率,只是在描述模型中的信息关系。例如地面湿润会提高下过雨的判断,却不能凭这条概率关系断言所有湿润都由下雨造成;模型还要考虑清洗、浇水等其他来源。
若只拿丙的 除以丙的不合格率 ,算出来的是原供货比例 ,并没有回答题目。若拿 除以 ,分母又混合了三种不同参照范围的比例。
后验概率的分母必须是证据 的总概率。这个总量包括甲的不合格品、乙的不合格品和丙的不合格品,因此要把完整的路径贡献 相加。画不出树也没关系,上面的四列表格已经把分子、分母放在了同一个量纲和同一个参照空间中。
换一组简单数字,把这三步放在同一棵树上:来源 A、B 的概率分别为 、,在两个来源中观察到证据 的概率分别为 、。先沿路径相乘,再汇总所有能够产生证据的路径,最后比较其中来自 A 的份额。

设某个虚构的检测模型中,目标人群的患病率为 。检测在患病者中的阳性率为 ,在未患病者中的假阳性率为 。现在从这个人群按模型随机选一人,结果阳性,患病的条件概率是多少?这里的数字只是用来理解公式。
很多人第一反应是 。但这个 的分母是“所有患病者”,而问题的分母是“所有阳性者”。我们要找的是阳性者中患病的人所占的比例,必须把未患病却阳性的路径也算进去。
设 表示患病, 表示检测阳性。由全概率公式,
因此
从 上升到约 ,这个信号已经明显改变了判断。只是未患病者在原人群里占绝大多数,即使每人误报的概率比较低,汇总起来仍会产生很多假阳性。忽略这个起点规模,只盯住检测在患病者中的表现,就是这里的基率谬误。
为了让比例更容易看懂,可以把模型放大成 人的理想化频数表:
在 个阳性对应的模型频数中,患病频数是 ,所以答案为 。表格里的数字是按概率缩放得到的数量,不能理解成现实抽取 人时一定恰好出现这些人数;有限样本会有随机波动。
检测在患病者中的阳性率称为灵敏度;在未患病者中的阴性率称为特异度。这个模型里二者都是 ,但阳性者的患病概率仍只有约 。三个量的条件不同,不能合并成一个含糊的“准确率”。同理,,但它不是假阳性率 。
若把基率从 改为 ,同时保持两种条件阳性率不变,后验会变成 。同一套检测参数对应了很不一样的答案,因为两条来源路径的相对大小变了。反过来,固定基率并提高特异度,减少的是假阳性路径的贡献;提高灵敏度,增加的则是真阳性路径贡献。
当我们只比较 与 ,且有关分母都为正时,将两个后验概率相除,共同的归一化分母会消掉:
概率 对应的赔率是 。因此上式可以读成:后验赔率等于先验赔率乘以似然比。它不改变计算内容,只是把“原来的相对机会”和“证据带来的倍数”分开写出来。
在检测例子中,先验赔率为 ,阳性的似然比是 。更新以后赔率变成 ,换回概率就是 。证据让赔率扩大了十九倍;由于原先起点很小,更新后的概率仍未超过一半。
假如检测了一次还不放心,又取得一份新证据。能不能把第一次后验当成新的先验继续计算?可以,但第二份证据的概率必须在“已经知道第一份证据”的前提下写出。
设两份证据分别是 ,候选来源为 。在相应条件概率存在时,
这个公式没有另起炉灶:把已经知道 的世界当成当前概率空间,再对 用一次 Bayes 公式即可。等价地,一开始就把两份证据作为联合事件,分子的路径贡献是
但我们一般不能把最后一项擅自换成 。第二份证据可能与第一份共享同一个误差来源,甚至只是把第一份记录复制了一遍。
举一个容易看清的问题:一个设备是否故障未知,系统发出了故障告警。你随后在两块屏幕上分别看到同一条告警,这不是两次独立的检测。第二块屏幕只是重复显示已经知道的内容,所以不会再提供一份同样强度的新信息。
如果模型明确规定,在给定故障状态后,两次检测结果相互独立,那么才可以把每个来源下的联合证据概率拆成两项乘积。这叫条件独立,下一章会专门解释。现在先记住:允许逐步更新,不等于允许把所有证据的似然直接相乘。
还有一种常见困惑,出在信息是怎样被提供的。不是所有听起来相近的消息,都对应样本空间里的同一个条件事件。
设有两个有编号的信号灯,完整状态“红红、红蓝、蓝红、蓝蓝”各以 的概率出现。我们想知道两灯都是红色的概率。下面比较两种观察方式。
第一种方式:一个程序查看两个灯,只报告“至少一个是红色”是否成立。现在报告为真。原来的四种状态中,只排除了蓝蓝,剩下三种仍各占相同权重,因此
第二种方式:观察者先独立、等可能地挑一个灯,只看被挑中的灯。现在看到的是红色。这个条件不是“至少一红”本身,而是“随机挑中的那个灯为红”。四种原状态触发这条消息的机会分别是 。
看到红色的总概率是 ,其中红红路径的贡献是 ,所以
两个答案不冲突。第一种筛选把三种符合条件的状态同等留下;第二种观察机制更容易在红红状态下报告红色,因而给红红更大权重。只说“知道有红灯”而不说明观察过程,会把这两种问题混在一起。
这也是处理抽样、推荐、筛选和报告问题的一条实用习惯:如果“这条消息会不会被你看到”本身受到真实状态影响,就把消息产生机制也放进概率模型。公式能够处理这项差别,但它不会替我们补齐题目没有给出的机制。
装置输出甲、乙、丙、丁的概率分别为 。已知输出属于甲、丙、丁,求输出属于甲、丁的概率。再求反过来的条件概率,并解释为什么不同。
盒中有六个红球、四个蓝球,连续不放回抽三次。求顺序为“红、蓝、红”的概率,再求三次中恰好两个红球的概率。
一个仓库中的包裹有 通过通道甲处理, 通过通道乙处理。甲通道包裹贴错标签的概率是 ,乙通道是 。随机检查一个包裹,求错标概率;若发现错标,求它通过乙通道的概率。
某批待发货商品中,甲来源占 ,乙来源占 。已知被抽到的商品属于加急订单,且在加急订单中甲来源占 、乙来源占 。甲来源加急订单迟发概率为 ,乙来源加急订单迟发概率为 。求这个加急订单迟发的概率。
某装置故障的先验概率为 。故障时单次检测告警概率为 ,正常时为 。先假设在给定故障或正常状态后,两次检测结果相互独立,求两次均告警后的故障概率。若第二次显示只是复制第一次记录,答案又是什么?
回头看,我们没有发明四种互不相干的算法。条件概率先在已有信息内重新归一化;乘法公式把归一化前后的量联系起来;全概率把互斥路径合并;Bayes 公式再在观察到的结果中比较来源。它们都依靠同一套概率公理,区别只在于当前已知什么、目标是什么。
读一道题时,可以先写出完整的目标符号,再画出或列出所有相关路径。沿路径乘的是在已有条件下继续发生的概率,合并互斥路径用加法,反向判断来源则用目标路径贡献除以所有证据路径贡献。若直觉与结果不一致,先检查参照范围、分块和消息产生方式,通常就能找到分歧在哪里。
下一章我们要专门研究一个看起来“什么也没发生”的情形:知道 以后, 的概率恰好没有变化,即 。为什么这能导出 ?为什么“不能同时发生”反而通常意味着不独立?又为什么在某个共同条件下独立的两次观察,整体上可能相互依赖?把本章的条件保留清楚,这些问题就有了可以逐步推导的起点。
| 丙 |
| 蓝蓝 |
不能按“剩下三种,其中两种有利”写成 ,因为三个结果权重不同。反过来,已知 发生,就已经保证 发生,因此 。两个问题的分母分别是 与 ,自然不必相等。
恰好两红有红红蓝、红蓝红、蓝红红三种互斥顺序。每种概率都是 ,因此总概率为 。也可以按组合计算:
这里三条路径相等,应通过每条路径的乘积或样本对称性确认;不要把“几种描述”自动当成“几种等可能事件”。
乙原先占 ,在错标群体中却占约 。原因是其路径贡献要同时结合来源规模和错标率,不能只比较其中一项。
答案是 。原来全部订单中的 和 不适用于当前参照范围。公式本身仍是全概率公式,但每项都已处于“加急”这个条件下。
若第二次只是复制第一次记录,“两次都显示告警”就是原来的同一条告警事件,不应再平方。此时后验为
区别来自证据产生机制,不是 Bayes 公式有两种互相矛盾的答案。