上一章我们已经把概率模型拆成了几个问题:一次观察记录什么,哪些结果算在模型里,哪些假设支持我们给出的概率。现在把这些问题往前推进一步。假如有人交给你一张概率表,里面每个数都在 和 之间,这张表就一定合理吗?
还真不一定。比如他一边说“出现偶数”的概率是 ,一边说“出现 2”的概率是 。每个数单独看都像概率,放在一起却说不通:出现 2 一定也出现偶数,一个范围更小的事件,不该比包含它的大事件还容易发生。概率论需要一套规则,让我们对不同事件的判断能够彼此对得上。
这就是本章要做的事。先把自然语言里的“发生”“或者”“没有发生”翻译成集合,再说明什么样的集合可以谈概率、什么样的赋值才叫概率。你在导论课里已经用过补集公式和加法公式;到了这里,我们会把它们从几条基本规则里推出来,也会看见一个初学时很容易忽略的区别:概率为零,并不一定表示那个事件是空的。
我们先拿一个简单过程说起:连续抛两次硬币,并按先后顺序记录正反面。一次完整结果可能是“先正后反”,也可能是“两次都反”。用 表示正面、 表示反面,全部结果构成样本空间

样本空间中的一个元素叫作样本点,通常写成 。例如 表示一次已经完整记录下来的结果。事件“恰好一次正面”则包含两个样本点:
一次试验得到 后,只要 ,我们就说 发生。所以事件并没有额外制造一种神秘对象,它是在结果集合里划出一块范围,用来表示我们关心的事情。
这里的“试验”也不要求在现实中能够原样重做。记录明天是否降雨、讨论某台已经售出设备的寿命,都可以建立概率模型。数学上真正需要的是:说明我们保留什么结果,以及如何对有关事件分配概率。独立重复试验是后面研究长期平均时需要的额外结构,不是所有概率问题的入场条件。
同样是抛两次硬币,如果只记“正面的次数”,样本空间可以缩成
这当然可以。不过,“次数为 1”已经把 和 合在一起了。在新空间里,你能回答“有没有出现正面”,却不能直接回答“第一次是不是正面”,因为先后顺序已经丢掉了。
把样本空间压缩,也会改变每个样本点应当带有的概率。若原模型规定四种有序结果等可能,都是 ,那么压缩后应当得到
中间那一项获得了两份 ,因为它对应两个原始结果。重新给结果起名字,不会自动把概率重新分成一样大。
两枚骰子也有同样的问题。若记录两枚骰子的点数,样本空间是 个有序对 ;若只记录点数和,样本空间变成 。在两枚骰子公平且相互独立的模型下,前一种空间的样本点等可能,后一种却不是:和为 7 对应 6 个有序对,和为 2 只对应 。
建模时,我们至少要检查:列出的结果能否覆盖模型允许发生的情况;一次观察会不会被重复记成两个不同样本点;记录的信息是否足以回答问题。概率怎样分配还要另行说明。一个列得很整齐的集合,本身并不带有“等可能”这个承诺。
抛两次硬币只有有限个结果。如果记录“首次成功出现在第几次”,可能结果是 ;如果模型还允许永不成功,就应当把这一种情况写成 并纳入结果空间。这是可数无限的情形:结果虽列不完,却可以一个接一个编号。
如果记录理想化的等待时长,样本空间可以取 。区间里的实数无法像正整数那样排成一列,它是不可数的。现实仪器可能只能读到百分之一秒,那是测量精度对记录方式的限制;连续模型则把时间当作一个实数。两种描述都能使用,但不能把它们的单点概率混为一谈。
这种区分稍后会变得很实际:可数空间可以把单个结果的概率加起来,连续空间通常要从区间这样的事件开始分配概率。我们先把事件之间的关系说清楚。
设一次掷骰子的结果空间是 ,令 表示“偶数”, 表示“至少为 4”。下面这些记号都可以从这一个例子读出来。

概率论中的“或”通常包含“两件事都发生”。因此“红牌或人头牌”也包括红色的人头牌。题目若想排除同时发生,应该写“恰好一个发生”;这时对应最后一行,也叫对称差,记作 。
还有一个很有用的关系: 表示 中每个结果也在 中。翻译成事件语言就是“只要 发生, 就一定发生”。例如“掷出 6”包含在“掷出偶数”中。以后遇到概率不等式,先找这种事件包含关系,常常比先列数字更直接。
下面的实验台使用 到 作为样本点。先选默认的“偶数 / 3 倍数”,检查交集是否恰好是 ;再清空两个事件,观察空集的补集是不是整个样本空间。这里操作的是集合成员关系,不需要为每个点预先指定概率。
如果 ,我们说 、 互斥:一次结果不能同时落在这两个集合里。“掷出 1”和“掷出 2”互斥,但它们没有覆盖全部结果,因为还可能出现 3 到 6。
如果 ,它们叫作对立事件。除了不重叠,还必须合起来等于整个样本空间:
“偶数”和“奇数”就是这样的一对。因而每一对对立事件都互斥,互斥事件却未必对立。
也先提醒一句:互斥与独立是不同关系。互斥说的是不能一起发生;独立说的是知道一个事件发生后,另一个事件的概率是否改变。我们会在后面正式定义独立,现在不要因为两个词都含有“互不影响”的日常联想就把它们换着用。
设 表示第 台设备发出告警。“至少一台告警”是并集,“所有设备都告警”是交集。它们的反面分别为
第一式说:至少一台告警的反面,是每台都没有告警。第二式说:所有设备都告警的反面,是至少一台没有告警。你不必把它们当成需要死记的两个符号模式。拿一个具体结果逐个检查:它不属于任何一个 ,恰好意味着它属于每一个 。
这两条规律对有限个或可数无限个事件都成立。以后写“最终总会发生”“从某次起不再发生”时,虽然语句更长,用的仍然是并、交、补这些基本运算。
前面用有限空间时,我们默认每个子集都能拿来问概率。现在把空间换成 ,就不能毫不解释地继续默认“所有子集都已经有概率”。严格的模型需要同时交代:哪些子集属于我们可以讨论的事件范围。
把这族事件记为 。它本身是一个集合,不过其中装的不是样本点,而是 的子集。我们要求它至少满足下面三条:
满足这些条件的 叫作 代数,也叫事件域。这里的要求其实很合乎我们讨论问题的习惯:既然允许问“ 有没有发生”,也该允许问“ 有没有不发生”;既然允许问一串事件,也该允许问“其中至少一个有没有发生”。 表示我们要求对可数的并运算保持封闭,不能只处理有限次。
由前两条可知 。由德摩根律可知可数交也在 里,因为可以先逐个取补,再取并,最后再取补。因此定义里不必把“交”“差”“有限并”重复列成更多条要求,它们已经能够推出。
仍然考虑骰子。如果模型保留全部点数信息,可以取
其中 表示全部子集组成的集合,叫作幂集。一共 6 个样本点,就有 个子集,每个都可以作为事件。
如果我们只想保留奇偶信息,也可以在同一个 上选取更小的事件域:
它是一个合法的 代数。两个中间集合互为补集;把其中任意若干集合取并,仍然只会得到这四个集合之一。但 不在 中,所以这个模型没有定义“恰好掷出 6”的概率。不要把“没有定义”读成“概率为零”:一个是模型没有给这件事赋值,另一个是赋了值且恰好为零。
更一般地,把样本空间分成互不重叠的若干块,再把这些块的所有可能并集收进来,就得到一个事件域。这样的分块叫作一个划分。分块越细,能区分的事件通常越多。这也解释了为什么事件域有时被理解成模型能表达的信息范围。
在实数轴上,我们至少希望区间是事件,例如“等待时间不超过 3 分钟”。由区间经过可数次并、交、补运算所生成的最小 代数,叫作博雷尔 代数,记为 。它包含开区间、闭区间、单点、可数集合,以及后续课程通常遇到的集合。
“最小”表示只要求把这些运算必然带进来的集合收齐。一般记号 ,就是包含一族给定集合 的最小 代数。你现在不需要逐一描述其中所有集合,但要知道实数轴上有标准的事件范围可用。
为什么不干脆让每个子集都有概率?在通常的集合论框架下,如果还要求长度具有平移不变性、可列可加性等自然性质,就会遇到不能按这种规则赋值的子集。我们不在这里构造它们;选定事件域,是让概率函数有一个明确且自洽的定义域。后面定义随机变量时,“可测”这个条件正是为了保证由数值条件产生的集合仍然是事件。
“事件是样本空间的子集”说明事件的形状;严格地说,还要补上“这个子集属于选定的事件域”。有限和可数离散模型通常取全部子集,因而这一区别暂时不显眼。连续模型里,我们需要把它保留下来。
现在三个对象可以放在一起了: 规定可能结果, 规定哪些集合是事件, 给每个事件赋予概率。三者组成一个概率空间:
把 看作定义在 上的实值函数,它必须满足三条公理。
非负性要求对每个 都有
规范性要求
可列可加性要求:如果 两两互斥,即不同下标对应的事件都没有交集,那么
最后一条最值得慢一点读。它并不是说“任何事件都可以直接加”,而是说互不重叠的部分合起来时,总概率等于各部分的概率之和。“两两互斥”也比“所有事件的共同交集为空”强得多:三个圆可以没有共同重叠的中心,却仍然有两两重叠的区域,那样就不能直接相加。
假设我们关心一个任务是否终会完成。事件“第 1 次完成”“第 2 次才完成”“第 3 次才完成”互不重叠,合起来表示“在某个有限次数完成”。这个并集没有固定的最后一项。只有有限可加性,还不足以直接把整个无限并集的概率写成级数。
可列可加性让有限计算能够走向这种无限问题。右侧级数的意义是有限部分和的极限;因为每项非负,没有正负抵消或改变求和顺序带来的歧义。后面的大数定律、分布函数和收敛问题,都要使用这座从有限走向无限的桥。
不过,“可列”不是“任意多”。实数区间里的点不可数,不能把单点概率放进上面的可列求和公式。这个边界稍后正好解释为什么连续模型允许每个单点的概率都为零。
如果三个互斥结果被赋予 ,它们的和虽然是 ,但有负数,因而不合法。如果赋予 ,三个数虽然都非负,但总和不是 ,也不能构成只有这三个结果的概率模型。
反过来,在一个有限空间上,只要各样本点的权重非负且总和是 ,并规定事件概率等于所含权重之和,就能得到合法概率。至于这个模型是否适合现实,还得继续检查权重的依据。公理不会告诉我们某枚硬币一定公平,也不会从“要么下雨、要么不下雨”推出各占一半。
在这里,我们把导论课里常用的规则逐个接回公理。掌握这些证明的用处是:下次换成不等可能或连续模型,你不必重新猜公式还能不能用。只要仍然是概率空间,它们就成立。
让可列可加性中的每个事件都取 。这些事件两两交集为空,于是
左边是一个有限的非负数。如果这个数大于零,右边的部分和就会无限增大,无法相等,因此只能有 。现在给有限个互斥事件 后面补上无限多个空事件,可列可加性就给出
这样证明有一个小好处:我们先得到了空事件概率,再得到了有限可加性,没有在证明过程中提前使用尚未推出的结论。
与 不重叠,并起来是 ,因此
移项得到我们已经很熟悉的公式:
又因为 ,所以 。和非负性一起,就得到了每个事件都满足 。
“至少一次”常用补集,是因为“至少一次”包含许多不同的发生方式,而“零次”往往只有一种结构。比如连续掷两次公平且独立的骰子,在 个等可能有序对中,两次都不是 6 的结果有 个。于是至少一次出现 6 的概率为
你也可以直接数第一次为 6 的 6 个结果和第二次为 6 的 6 个结果,但 会重复一次,最后仍是 个。补集公式和加法公式是在用不同分块方式回答同一个问题。
如果 ,我们可以把 拆成 与剩余部分 。两块互斥,故
这就是单调性。开头那张把“偶数”概率写得比“出现 2”还小的概率表,在这里被正式排除了。
同一条等式还说明,只有在 时,才可以直接写
若没有包含关系,需要减去的只是 中与 重叠的部分。因此一般形式为
做减法前先看清究竟扣掉哪一块,能避开不少“数字算对了,集合却错了”的情况。
假设 两两互斥,且并集为 ,也就是它们构成一个可数划分。每个事件 都可以写成
理由很直接: 里的每个样本点恰好落在一个 中。于是我们既没有漏掉它,也没有重复数它。
例如把一批产品按生产线分成几个互斥类别,事件“不合格”就能拆成“来自各条生产线且不合格”的若干部分。现在这只是可加性;后面学到条件概率,我们会把每一块再写成两个概率的乘积,从这里自然得到全概率公式。
设 表示抽到红牌, 表示抽到人头牌,其中人头牌指 J、Q、K。标准 张牌中,红牌有 张,人头牌有 张,红色人头牌有 张。如果直接相加 ,那 张牌被数了两次。
把重复的一份扣掉,就得到 张。在每张牌被等概率抽中的模型下,所求概率为 。背后的集合恒等式可以证明为
第一步把并集拆成互斥的 与 ,第二步使用刚证明的差事件公式。这叫两个事件的加法公式,对所有概率模型都成立,并不依赖等可能。

图中把刚才的加减过程拆成三步。先分别看两个事件,最后只保留一份重叠区域,就能看出为什么必须减去一次交集。

设三个告警事件为 。先把单个事件加起来,再扣掉两两交集,会出现一个新问题:同时属于三个事件的结果,先被加了三次,又被减了三次,净计数变成零。它明明属于“至少一个告警”,应该算一次,因此要再加回三重交集:

这里的两两交集包括三重交集中的结果。例如 的意思是 和 都发生,不排除 也发生。若题目给的是“恰好两类告警”,它已经排除了三重交集,不能把该数值原封不动填进上式。
举个完整的有限例子:从 台设备中等概率抽一台,三类告警分别出现在 台设备上;两两同时出现的台数分别为 ,三类都出现的有 台。那么至少一种告警的设备有
台,概率是 ;没有任何告警的概率是 。这个计算没有假设三类告警独立,交集信息已经由题目直接给出了。
更一般地,对 个事件,容斥公式写为
读这个记号时,把 看成一组挑出来的下标:挑一个就加,挑两个就减,挑三个又加。为什么如此交替恰好有效?一个属于其中 个事件的样本点,在右边总共被计入
次。这来自 。没有属于任何事件的点则一次也不会计入。严格地说,可以把整个空间按“属于哪些事件、不属于哪些事件”分成至多 个互斥的块;每块在右侧恰好保留一次,再对这些块使用有限可加性,就得到公式。这样证明也适用于连续空间,不需要把单点概率加起来。
现实中我们未必知道所有交集。好消息是:直接相加虽然可能重复,却不会漏掉并集,因此总有
这个结论叫作并集上界,也叫次可加性,不要求事件独立。如果 个检测环节各自发生误报的概率都不超过 ,那么至少一次误报的概率不超过 。误报之间可能相关,所以上式只是一个保证有效的上界,不一定是准确概率。
它也适用于可数无限个事件。证明时把重叠的集合改成“第一次被哪一项收进来”的互斥块:
这些 两两互斥,合起来与原并集相同,而且 。所以可列可加性与单调性给出
还有一个可以顺手得到的范围,用来检查给定概率是否自洽:
右边来自交集包含于两个事件;左边来自加法公式和 ,再与非负性合并。例如若 、,它们至少要有 的概率重叠,不可能互斥。
到目前为止,我们一直在拆集合、加概率。现在考虑一个带极限的问题。把“等待不超过 1 分钟”放宽成“不超过 2 分钟”,再放宽成“不超过 3 分钟”,对应的事件越来越大。它们的概率会不会趋近于“等待时间有限”的概率?
可列可加性保证答案是会。设
我们记作 ,称事件序列递增。这时有下连续性:
证明并不需要额外引入分析技巧。令 ,并对 令 。 就是第 次新加进来的部分,它们两两互斥。
整个 是这些新增部分的可数并,而 是前 块的并,因此
级数的定义就是部分和的极限,于是结论成立。这里“连续”表达的是:在一串逐步扩大的事件里,不会有一份概率等到无限远才凭空跳出来。
若事件越来越小,记作
它们的补集就越来越大,且 。用下连续性和补集公式,得到上连续性:
在概率空间里总概率是 ,所以不必另外要求首项有限。若将来把概率推广到可能取无穷大的测度,上连续性就需要有限性条件;这里能够顺利做减法,是因为没有遇到无穷减无穷。
看一个容易分辨端点的例子。在 的均匀模型中,令
两者的概率都是 ,所以都趋于 。但是它们的交集不同:,因为每个正数最终都会超过 ;,因为 一直没有被剔除。概率极限一样,并不意味着极限事件是同一个集合。
假如 在两个不同事件之间来回交替,这一串事件就未必有上面这种单调关系。即使 恰好是同一个数,也不能随手把它解释成“某个逐步收缩的事件”的概率。应用定理时要先写出递增或递减关系,再找清楚并集或交集是什么。
后面写分布函数 时,我们会再次用到这一点:阈值逐步下降,事件也逐步缩小,概率的上连续性会告诉我们 为什么右连续。现在证明的性质,将来会直接决定分布函数应当长什么样。
空事件肯定有零概率,但反过来呢?在有限且每个样本点概率严格为正的模型里,非空事件至少含有一个正权重点,概率当然大于零。日常掷公平骰子的题目常常处在这种环境,容易让我们误以为“零概率”和“空事件”可以互换。
连续模型会立刻打破这个印象。在 的均匀模型里,一个区间的概率等于它的长度。固定一个点,例如 。对任意足够小的 ,单点事件 都包含在长度为 的区间中,因而
这个上界可以任意接近零,所以 。但集合 明明不是空的, 也没有被排除出样本空间。
这时通常会冒出一个疑问:每个点的概率都是零,为什么整个区间的概率不是零?原因是可列可加性只允许对可数个互斥事件求和, 的点却不可数。你不能把这条公理扩大成一个关于“不可数个零相加”的公式。
如果只取 中的有理数,情况又不同。有理数可以排成一列 ,因此
所以在这个模型里,取到无理数的概率为 。这并不是说有理数不在区间里,也不是说计算机真的能够存下一个无限精度的随机无理数;它说的是理想连续模型的事件概率。
若 ,我们称 几乎必然发生,或说“以概率一发生”。这意味着 概率为零,不要求 是空集。集合上的必然事件则是整个 ,其中没有任何例外结果。
例如,在无限次独立公平抛硬币的序列空间里,令 为“前 次全是反面”。这些事件递减,而且
它们的交集是“永远都是反面”,这个集合包含那一条全反面的无限序列,并非空集。由上连续性,
因此“最终出现正面”以概率一发生。不过,对任何固定的 ,“前 次还没见到正面”仍然有正概率 。概率一的无限期结论,没有给出某个有限次数内必定成功的保证。
零概率也不必等到连续空间才会出现。有限模型可以允许某个样本点的权重是零,只要其余权重非负且总和为一。因此准确说法始终是:空事件一定为零概率;零概率事件是否非空,要回到具体样本空间查看。
集合回答“模型是否包含这样的结果”,概率回答“事件被赋予多大权重”。概率为零与集合为空、概率为一与事件等于整个样本空间,是两组不同的判断。后面读大数定律中的“几乎必然”时,我们必须保留这个区别。
现在再回来看最熟悉的公式。设有限样本空间有 个样本点,而且模型规定各点等可能。若共同概率为 ,有限可加性与规范性给出 ,所以每点概率为 。于是对任何事件 ,
原来“有利情况数除以总情况数”不是独立于公理的一条万能定义,它是有限、等可能模型中的一个推论。对不等可能的有限模型,正确的通式仍然是
举例说,一个转盘的三种颜色对应概率 ,落在后两种颜色中的概率是 ,并不是“三种里占两种”得到的 。数的是类别数量,实际需要加的是各类别的概率,两者只有在同权重时才成比例。
两枚公平且独立的骰子,点数和至少为 10 的有序结果为
在 个等可能有序对中占 个,概率为 。如果改用点数和作为结果,就应给和为 的三个点分别赋予 ,相加仍是 ,不能用 。
“两个孩子中至少一个男孩”的常见练习,也必须明确它采用的是简化模型:按出生顺序记录,每个孩子的两种性别结果各占一半且相互独立。在这些假设下,四种有序结果等可能,至少一个男孩占其中三种,概率才是 。如果只记男孩人数 ,相应权重为 ,并非各占 。这个例子讨论的是指定模型的数学结构,等可能和独立都不能从结果名称本身推出来。
下面的辨析器可以在细、粗两种记录方式之间切换。硬币场景采用公平且两次独立的模型;孩子场景采用上述各占一半且相互独立的简化模型。把同一场景切换为粗粒度后,留意目标事件的正确概率保持不变,改变的是结果分组和各组权重。
有人也许会说:“那就在所有正整数中均匀随机挑一个。”如果这指的是每个正整数具有相同概率 ,它不能构成一个可列可加的概率模型。
若 ,选足够多的整数,有限部分的总概率 就会超过 。若 ,可列可加性又会使所有正整数的概率之和等于 ,而不是 。没有其他非负的 可选。因此正整数上的概率分配必须是不等权的,例如
这个赋值完全合法。比如抽到偶数的概率可以按照可列可加性计算:
我们从有限空间走到可数无限空间,保留下来的不是“数量比数量”,而是“非负权重相加等于一,事件概率由所含权重相加得到”。
做题时先把事件写清楚,再决定需要补集、分块还是极限。下面的题不要求复杂运算,重点是每一步都有对应的集合依据。
练习一:样本点与事件。 连续抛三次硬币,记录先后顺序。写出样本空间,以及“恰好两次正面”的事件。如果只记录正面次数,哪些原始结果会被合并?在公平且独立的假设下,两个记录方式怎样给出相同概率?
练习二:事件域是否封闭。 在 上, 是 代数吗?如果只要求它包含 ,最小的事件域是什么?
练习三:检查一组概率信息。 已知 、,有人声称 。这组信息能成立吗?如果改为 ,求“恰好一个发生”和“两个都不发生”的概率。
练习四:概率连续性。 在 的均匀模型里,令 ,其中 。求 及其概率。为什么不能只看右端点趋于 1,就把并集写成 ?
练习五:零概率与可数并。 设 都是零概率事件。证明它们的并仍为零概率。这个结论能否用来证明 的均匀模型中“整个区间概率为零”?
练习六:从公理走到计数。 从编号为 到 的卡片中等概率抽一张。令 为“编号能被 2 整除”, 为“编号能被 3 整除”,求至少满足一条的概率。若卡片抽取概率不等,这个计数答案还能直接使用吗?
现在我们已经能说明一个概率模型由什么组成,也知道常用概率公式为什么成立。接下来,当模型确实有限且等可能时,主要工作就转移到了“怎样把结果数全,又不重复”上。下一章的排列、组合与各种计数方法,正是为这个已经有了公理依据的数量比服务的。
| 没有发生 |
| 发生而 不发生 |
| 、 恰好发生一个 |
也可以拆成 的 和 的 ,相加仍是 。
与 的概率一样,是因为它们只差一个零概率单点;两个集合本身仍然不同。事件的并集要按“是否属于某一项”判断,不能直接用数值极限替换集合端点。
所以可数个零概率事件的并仍为零概率。它不能用于所有区间单点的并,因为区间有不可数个点。这正是不能把“可数”省略掉的地方。