学过一点概率之后,你大概已经会说:“公平骰子掷出偶数的概率是二分之一。”“硬币抛得足够多,正面的比例会接近一半。”这些话听起来都很自然。不过,如果我们往前多问一步,事情就没那么简单了:为什么骰子的六个点数可以平分概率?“足够多”到底保证了什么?一次试验还没有发生时,那个概率数值又是从哪里来的?
这门课要把这些以前凭直觉接受的说法重新理一遍。随机变量、分布、期望、大数定律和中心极限定理都在后面等着,但我们先从更靠前的位置开始:面对一个不确定的问题,怎样把它写成一个能讨论、能计算,也能检查的数学模型?
我们会反复区分两件事。一件是在已经选好的模型里进行推理,例如从“六个点数等可能”推出“偶数概率是二分之一”;另一件是判断这个模型是否适合手里的骰子。第一件事需要数学证明,第二件事需要观察、试验和对现实机制的了解。把它们混在一起,最容易出现一种错觉:公式算对了,现实结论就一定对。

想象你在公交站等车。“等车这件事有随机性”当然没错,但这句话还不足以让我们开始计算。你关心的是五分钟内能否上车,还是准确等了几分钟?计时从走到站台开始,还是从上一班车离开开始?如果当天已经停运,又打算怎样记录?这些选择不同,最后得到的数学问题也不同。
我们把观察规则明确、结果在事前尚未确定的过程称为随机试验。这里的“试验”可以是掷骰子、抽取一件零件,也可以是记录明天某个地点的降雨情况。它不一定发生在实验室里,更不要求现实能原封不动地重新来一次。
明天只有一个,你不可能把同一个明天重复一千次,但仍然可以讨论明天是否下雨。又比如一张已经抽出、尚未翻开的卡片,卡面在物理上早已确定,对不知道卡面的人来说,它仍然构成一个可以建立概率模型的不确定问题。概率讨论所依据的信息和观察方式,需要写进问题;物理上的可重复性不是所有概率模型的必要条件。
可以重复的试验非常有用,因为它让我们有机会用数据检查模型。只是“有利于检查”与“没有它就不能定义概率”不是一回事。后面研究大数定律时,我们会明确写出独立重复等条件,不能在课程开头把这些条件悄悄塞进所有概率问题的定义里。
再看“明天下雨的概率”。它至少需要一个地点、一个时间区间和一个降雨判定标准。整座城市里有任意一点飘雨,和指定观测站在一天内记录到达到规定阈值的降水,不是同一个事件。我们不用在每道数学题里讨论气象细节,但必须知道:一句自然语言只有划清边界,才能对应一个确定的事件。
公交问题也是这样。如果只研究某条线路仍在运行时的等待时间,可以约定从乘客到达站台开始计时,记录下一班可乘车辆到达前的分钟数。如果允许停运,就得增加“当天没有车可乘”这一种结果,或者明确把研究范围限定在正常运行时段。不能一边说“包含所有情况”,一边把不方便计算的结果漏掉。
这一步还没有概率公式,却决定后面每个公式在说什么。尤其要留意“未作答”这样的记录:如果直接把它从调查结果里删掉,我们分析的对象就可能从“所有被抽中的学生”变成“愿意回答的人”。删掉的是一个类别,改变的可能是整个问题。
观察规则选好之后,我们把模型允许的一切结果放在一个集合里,叫作样本空间,记为 。其中一个具体结果叫作样本点,记为 。
只记录一次掷骰子的朝上点数时,可以写成:
如果试验结束后看到点数为 ,就表示这次得到的样本点是 。这里的数字是我们选定的记录标签;换成六种颜色也不影响样本空间的基本作用。
一个样本空间至少要让观察结果有确定的归属。比如我们把等待时间分成“不到五分钟”和“超过五分钟”,恰好五分钟就无处可放。若改成“不超过五分钟”和“不少于五分钟”,恰好五分钟又同时属于两种记录。作为最细记录的类别,应当既覆盖研究范围,又避免重叠。可以改成“不超过五分钟”和“超过五分钟”,这样边界就清楚了。
还是掷骰子。如果只关心奇偶,我们完全可以使用另一个样本空间:
如果只关心是否大于 ,则可以用:
这三个样本空间没有谁天然更正确。记录六个点数,保留的信息多一些;记录奇偶,信息少一些,却已经足够回答有关奇偶的问题。代价也很明确:如果数据库只保存了“偶”,事后就没法再从这条记录判断当时是 、 还是 。
我们可以把从详细记录到粗略记录的转换写成一个规则 :
这个规则没有随机性。输入 ,它永远输出“偶”。随机的是试验最后给它哪一个输入。后面讲随机变量时,我们会把这个想法用到数值记录上:把原始结果通过一个固定函数转换成数字,得到的就是随机变量的基本结构。
假定这枚骰子公平,每个点数的概率都是 。在奇偶记录中,“偶”包含原来的三个点数,所以它的概率是:
在阈值记录中,“大于 ”只包含 和 ,因此:
注意,这两个粗略样本空间都只有两个元素,却分别给出了 和 。这直接说明:结果种类有几个,与每种结果是否等可能,是两个不同问题。
下面这个表把信息合并的过程放在一起。你可以从左向右读成“这次记录保留了什么”,也可以从右向左追问“这个类别包含了哪些原始结果”。
我们后面会反复做这种工作:先在信息充分的空间上建模,再把概率转移到真正关心的记录上。分布、随机变量的变换乃至条件概率,都和“哪些结果被保留、合并或者排除”有关。
下面的选择器可以把同一个过程切换成不同的记录方式。先选“掷骰子”,依次查看点数、奇偶与是否大于 ,留意每次哪些原始结果被合并。再切换到公交等待,比较区间记录与“是否超过十分钟”的区别。这里的公交模型限定在正常运行、最终能够等到车的情形;若允许停运,必须补上相应结果。
选择器展示的是样本空间和事件的变化,没有自动替你确定概率。即使界面上的新空间只剩两个类别,仍然需要回到原始结果的概率分配,才能判断它们是否各占一半。
把这两种简化记录并排放在一起,差别就更清楚了。图中两条路线都从同一枚公平骰子的六种结果出发;每次合并,都把原来的概率一起带过去。

样本点回答“这次具体得到了什么”,事件回答“这次是否满足我关心的条件”。在六点骰子的模型里,“得到偶数”对应的事件是:
如果实际结果 落在 中,我们就说事件 发生,写成 。结果是 时, 发生;结果是 时, 不发生。事件本身是一个集合,不是试验结束后才产生的真假值;试验结束后,我们才能判断这次是否落进这个集合。
一个样本点也能组成事件。例如“恰好得到 ”是 。严格写法中, 是点, 是只含这个点的集合。概率赋给事件,所以完整写法是 。以后常见的 ,也是“所有使 等于 的原始结果组成的事件”的简写。
如果记 ,那么“偶数而且大于 ”只对应 ;“偶数或者大于 ”则对应 。这里的“或者”允许两件事同时成立,因此 应当算进去。事件语言的一个实际好处,就是逼着我们把这类容易含糊的词说清楚。
本章先掌握这些符号的读法: 表示两者同时发生, 表示至少一个发生, 表示 没有发生。下一章再把它们的运算规则和概率公理逐一建立起来。
假如我们只保存了奇偶,能否讨论“点数为 或 ”?作为现实问题当然能问,但当前的记录不足以直接区分它。“偶”里面既有 、,也有 。只看这个粗略结果,无法判断该事件是否发生。
这提醒我们,除了写出 ,还需要说明允许讨论哪些事件。我们把这族事件记作 。在本章使用的有限完整模型里,可以让 包含 的所有子集;在更一般的模型里,事件系统需要单独指定。
一个适合概率运算的事件系统,应当包含整个样本空间,允许我们对事件取补,也允许把可数多个事件取并。“可数多个”包括有限多个,以及能够按 排列的无限多个。这种结构叫作 -代数。现在不必抢着研究它的所有性质,只要先明白用途:我们需要一套对常用逻辑运算封闭的问题集合,避免算到一半产生一个模型没有定义概率的事件。
有限模型通常可以把每个子集都当成事件。到了连续模型,我们会使用包含区间等常见集合的事件系统,不会默认任意古怪子集都有可用的概率。这里先把位置留出来,后面定义随机变量和分布时就不会突然冒出一个没有来由的条件。
现在有了结果集合,也有了我们关心的问题,还差最关键的一步:给事件分配概率。一个概率空间通常写成:
是结果集合, 是事件的集合, 是给每个允许事件分配概率的规则。只写“合格、不合格”完成的只是第一部分;不合格概率究竟是 、 还是 ,样本空间本身不会替我们决定。
设样本空间是有限集合 。给第 个结果分配概率 ,要求:
第一条排除负概率,第二条表示全部可能结果合起来占据完整的概率份额。然后,一个事件的概率就是其中各点概率的总和:
为什么能直接加?因为一次试验最终只得到一个样本点。事件 中这些不同点代表互不重叠的发生方式,所以把它们的概率份额加起来,就得到落入整个事件的概率。
我们来看一个并非等可能的模型。一台设备完成一次检测后,输出“通过”“复检”“失败”三种状态。为了演示建模,假设在指定运行条件下,我们采用如下概率赋值:
这些数都是非负数,且加起来等于 ,因此构成一个合法的有限概率模型。若事件 是“不能直接通过”,它包含“复检”和“失败”,于是:
如果某人填写的是 ,总和变成 ,模型就不合法。不能解释成“设备状态比较复杂,所以总概率超过了 ”。要么三种状态并不互斥,要么赋值出了问题,我们必须回到记录规则或概率数值上修正。
上面的模型里,令 为“结果不是失败”,则 ,概率为 。如果把 当成“ 或 ”的概率,会得到 。
问题在哪里?“复检”在 中出现过,又在 中出现过,被算了两遍。实际上 已经包含全部三种状态,所以概率应当等于 。把重复的那一份减去,得到:
这次计算让我们提前看到一般公式的理由:
若 ,即两事件互斥,没有重复部分,才可以直接相加。下一章会从公理证明这些规则;这里先借助点概率求和,把公式背后的“重复计算”看清楚。
若一个有限样本空间有 个结果,并且它们确实等可能,每个点就只能分到 。包含 个点的事件因此有概率:
“有利结果数除以总结果数”是从等可能赋值推出来的结果。它不是一个适用于所有样本空间的概率定义。
比如明天下雨与不下雨是两个类别,但我们没有理由只根据类别数把它们各分一半。前面设备的三种状态也不是各占三分之一。即使最初的详细结果等可能,合并成大小不同的类别以后,新的类别通常也不等可能。后面学习排列组合时,请一直带着这个提醒:数得再准确,也必须先确认自己数的是等可能的结果。
空集 中没有任何结果,因此它代表不可能事件,概率为 。整个样本空间 包含模型允许的全部结果,所以它是必然事件,概率为 。
这两个方向没有问题,但我们不能立即把它们反过来说成“概率为零的事件一定为空集”“概率为一的事件一定包含每个样本点”。在有限空间中,如果每个点都具有严格正的概率,确实可以这样反推;一般概率模型没有这个保证。
先看一个连续的例子:把 上的均匀选择理解为区间概率等于区间长度。对于任意足够小的 ,恰好落在 这一点的事件,被包含在附近长度为 的小区间中,因此:
这个上界对任意足够小的正数 都成立,所以只能有 。但 明明不是空集。一次选择也总要落在某个点上;我们不能因为每个固定点的概率都是零,就说选择根本不可能发生。
这里没有矛盾。概率要求对可数个互斥事件可加,并没有要求把不可数多个点的概率像有限求和一样相加。连续模型如何给区间赋值,下一章以及后面的分布章节会继续解释。
“概率为零”说明某个事件在模型中没有正的概率份额,不等于它在集合意义上不存在。同样,“概率为一”通常表示几乎必然,仍可能留有零概率的例外。以后读极限定理时,这个区别会直接影响我们怎样理解“保证”。
“正面概率是二分之一”与“这次抛一百次,正面出现了四十七次”说的是不同层面的东西。前者给出模型参数,后者报告一批已经发生的数据。
设前 次观察中,事件 出现了 次。它的相对频率是:
例如抛一百次硬币出现四十七次正面,正面相对频率就是 。换一批一百次,可能得到另一个比例。即使我们始终使用 的模型,频率也会随着具体结果波动。
在导论课里,你可能已经接受过“抛得越多,频率越接近概率”。这句话有正确的直觉,也省略了关键条件。我们需要说明多次观察如何联系在一起。若假定每次正面概率相同,且各次相互独立,大数定律才会把这份直觉落实成严格结论。只说“观察次数很多”是不够的。
一个极端反例能看清这个条件:只抛一次公平硬币,然后把那一次结果复制记录一万遍。每个记录单独看,正面概率仍是 ;可一万条记录的正面比例只会是 或 ,绝不会靠近 。记录条数多,不等于获得了很多独立信息。
假如前十次里恰好有五次正面,频率正好等于 。第十一次不论是什么,新的频率都会变成 或 ,反而离 更远。这并不违反大数定律,因为它没有承诺每一步的偏差单调缩小。
我们可以直接算出增加一条记录对频率的影响。用 表示第 次是否出现事件 :出现时取 ,没有出现时取 。那么:
减去原频率,有:
由于 和当前频率都在 与 之间,每一步改变量的绝对值至多为 。所以记录越来越多后,单条新数据对累计比例的影响会越来越小。
但这还不是大数定律的证明。步子越来越小,并不能单独保证最后走向指定的位置;前面“复制一次结果”的例子中,频率甚至从头到尾不动,却仍然不等于 。大数定律还要利用独立性等假设,解释频率为什么靠近期望值。我们在这里先把两层理由分开:一个解释单次更新的幅度,一个解释长期稳定的位置。
在独立且公平的硬币模型中,已经连续出现八次正面,第九次反面的概率仍是 。硬币没有一张欠账表,不会为了让前九次看起来平均而调整下一次结果。
那开头的八次正面怎样被“消化”?假定之后又有 次独立抛掷,其中正面次数为 ,全部记录的正面比例是:
第一项随着 增加而趋于 ,第二项中前面的权重趋于 。如果后续的正面比例趋于 ,整体比例也就趋于 。开头那段异常记录的影响被总量稀释,不需要未来出现一段专门与它对冲的反面。
这里还有一个建模层面的细节。如果“硬币公平”并不是已知条件,而只是我们的初始猜测,一长串正面可能促使我们怀疑这枚硬币并不公平。那是在用数据修正模型,不是在固定的公平独立模型中发现了“下一次必须补偿”。后面学条件概率时,我们会把已知机制下的推理与未知机制下的信息更新说得更精确。
理论概率未必容易算,计算机却可以很快生成很多次模型中的试验。模拟的想法很朴素:按照指定规则反复生成结果,再观察事件发生的比例。
例如想模拟正面概率为 的一次硬币试验,可以先生成一个在 上近似均匀的数 ,当 时记正面,否则记反面。理想均匀模型下,区间 的长度为 ,这就解释了为什么该规则给出所需的正面概率。 时从不记正面, 时总记正面,边界也和模型一致。
实际计算机使用伪随机数发生器,在有限精度下生成数值。它们可以帮助我们观察概率模型的行为,但仍需检查程序有没有写对:判断的是小于 还是别的阈值?各次是否生成了新数?累计次数和正面次数是否同步清零?画图时展示的是次数还是比例?把输出画成漂亮曲线,并不自动消除这些问题。
尤其要分清模拟与现实验证。如果程序里预先设定 ,模拟后得到接近 的频率,只说明程序在一定程度上表现出了这个模型的预期行为,不能证明桌上的某枚真实硬币公平。真实硬币是否适合该模型,需要真实的观察资料。
下面的模拟器使用每次重新生成的伪随机数,按照正面概率 进行投掷。先逐次点击,观察前几次比例的大幅变化;再增加一百次,比较累计次数、正面次数与比例是否对应。重置后得到另一条轨迹,看看它是否必须始终比前一条更接近 。
界面中关于“校准模型”的文字,在这个模拟器里只能理解为检查程序输出与设定机制是否相容。程序已经使用了 ,它没有采集真实硬币数据,因而不能据此判断某枚真实硬币是否公平。也不需要把曲线画得平滑才算成功:它应当保留实际生成的累计频率,允许偏差暂时增大。
同样,一次模拟曲线靠近理论值,也不能取代对大数定律的证明。证明要处理所有满足假设的模型和任意足够大的样本规模,说明偏离事件的概率如何变化;一段模拟只展示某次运行的有限数据。模拟很适合形成直觉、寻找程序错误、估计难算的概率,我们会用它,但不会让它承担它做不到的工作。
同样写成 ,背后的理由可能完全不同。它可能来自明确的随机抽样装置,也可能来自历史资料和当前信息。概率运算规则可以统一,建模理由却不能省略。
最容易理解的是有清楚抽样机制的情形。一个盒子里有十张外观一致的卡片,其中七张印着圆形;如果抽取机制使每张卡片等可能被抽中,抽到圆形的概率就是 。这里支撑数值的是卡片组成与抽取机制。“随机抽”这三个字必须有实际含义;如果圆形卡片较大、更容易摸到,等可能假设就需要重查。
也有数值来自资料估计的情形。比如我们用过去相同运行条件下的检测记录估计复检概率。这时历史频率帮助我们选择参数,但参数不必等于下一批记录的频率。资料是否足够、条件是否相近、设备是否老化,都影响这种外推是否合理。
一次性事件也可以根据当前信息建立概率描述。它的困难常常不是“不能使用概率”,而是如何说明信息、假设和数值的依据。如果后来得到新信息,概率判断可能改变,这不意味着概率规则自相矛盾;我们讨论的已知条件发生了变化。
一张盖住的卡片体现的是信息不足;抽哪张卡由随机装置决定时,又有抽样机制带来的变化。传感器的问题则可能是读数与我们想测的量不一致。我们需要说明的是读数本身的分布,还是读数减去真实值的误差分布,不能用同一个“有噪声”把问题带过去。
模型简化更需要仔细理解。把人的意见归为“支持”和“不支持”,并不会凭空创造一个随机装置;它先改变了我们的记录方式。如果“未决定”的人被强行分进其中一类,模型可能漏掉与问题有关的信息。概率可以描述保留下来的类别及其不确定性,却不会自动修复错误分类。
我们不用先解决“世界究竟在哪一层是随机的”这样的哲学问题,才能使用概率。但必须把数学模型的假设说清楚,也承认它只描述选定范围内的不确定性。
把前面几个概念放进同一个问题里。设某批次共有 件零件,其中 件不合格。为了把建模逻辑看清楚,我们先假定这两个数字已经知道,检测本身不会误判,而且每件零件被抽中的机会相同。问题是:抽一件,抽到不合格品的概率是多少?
最详细的样本空间可以直接使用零件编号:
事件 是那些不合格零件的编号组成的集合,共有 个元素。均匀抽取意味着每个编号的概率是 ,因此:
如果我们只保存检测状态,可以把记录压缩为“合格”和“不合格”,但概率必须随之转移,分别为 与 。它们不是各占一半,也不需要在粗略空间里重新猜一次概率。
假如零件沿货架分布,抽检员总拿最外面容易碰到的那几十件。我们还能直接使用 吗?不能仅凭总数就这样算,因为“每个编号等可能被抽中”已经缺少依据。如果不合格件恰好集中在外层,抽到不合格的概率可能高于总体比例;如果集中在里面,则可能低于总体比例。
这时一般的有限模型仍然可用,只是各编号的概率不再相同。若编号 被抽到的概率是 ,则:
数学没有失效,失效的是我们想省掉的建模步骤。一个总体中的比例,要变成抽样结果的概率,必须通过具体的抽样机制连接起来。
回到均匀抽取。如果每次抽完把零件放回,充分混合,并假设各次选择独立,那么每次抽到不合格的概率都是 。如果不放回,抽过的编号不能再次出现,后续选择就会受到前面结果的影响。
例如已知第一次抽到不合格品,剩下 件中只有 件不合格;已知第一次抽到合格品,剩下的 件中仍有 件不合格。这两个情况下,第二次抽到不合格的概率分别为:
我们还没有正式讲条件概率,但已经能看见它为什么有必要:新信息改变了当前可选对象和概率分配。也能看见独立性为什么必须另行假设——“每次都是抽一件”不代表“每次都不受前面影响”。
现实抽检往往恰好反过来:我们不知道总体不合格比例,所以才去抽样。设历史稳定生产时采用的初始模型是 ,现在按既定程序检测 件,得到 件不合格,观察频率为:
高于初始的 ,值得调查,但不能只用“这两个数不一样”就宣布模型被逻辑推翻。有限样本本来就有波动;要判断这种差异有多异常,需要进一步建立多次抽检的联合模型,并计算相应的尾部概率。这会用到后面的分布和极限定理。
在开始复杂计算之前,仍然要先排查更直接的问题:抽样是否覆盖当前批次?历史与当前的检测标准是否一致?是不是同一设备连续产生了一组相关的缺陷?记录中有没有重复样本?如果数据来自另一个机制,再精细地计算初始模型的概率,也回答不了实际问题。
数学上合法的模型,不一定适合现实;一批数据与模型预期有差异,也不一定代表模型必然错误。我们要分别检查概率赋值是否自洽、假设是否符合观察程序,以及偏差在这些假设下究竟有多罕见。
练习一:两个类别能不能各分一半?
一个袋子里有 张外观相同的卡片,其中 张红色、 张蓝色。按每张卡片等可能的方式抽一张,只记录颜色。写出详细样本空间与颜色样本空间中的概率,并说明为什么“颜色只有两种”不足以得到 。
练习二:一组概率数值够不够合法?
一次服务请求最终被记录为“成功”“超时”“其他失败”三类,概率分别为 ,三类互斥且覆盖全部结果。求“没有成功”和“不是其他失败”的概率,再求这两件事至少一件发生的概率。
练习三:记录足够多,频率就一定稳定在概率附近吗?
只运行一次正面概率为 的硬币试验,然后把这次结果复制成十万条记录。每条记录的正面概率是多少?十万条记录的正面比例又可能是多少?
练习四:一次没有下雨,能不能否定七成概率的预报?
一份预报对明确地点、明确时间段内的降雨事件给出概率 ,最后没有下雨。这是否说明预报在逻辑上矛盾?如果要检查这类预报,应当收集什么信息?
练习五:概率为零,是不是意味着这个结果不在样本空间里?
在 上均匀选择一个数,考虑事件 。解释为什么 不是空集,但 。如果只记录保留两位小数后的结果,“记录为 ”还是同一个事件吗?
现在再看到一个概率问题,我们可以先追问:一次记录是什么,全部结果有哪些,目标事件包含哪些结果,概率按什么机制分配,多次观察之间又有什么关系。把这些交代完整,后面的计算才有确定含义。
接下来,我们会正式研究事件运算和概率公理。从“互不重叠的概率份额可以相加”出发,推导补事件、并事件、包含关系与可数运算的规则。再往后,随机变量把结果翻译成数,分布整理这些数的概率,期望描述按概率加权的平均;到了大数定律,我们会回头证明本章暂时借用的频率直觉。现在留下的问题,会在各自需要的地方得到明确的条件和证明。
| 是否大于 | 分别是 |