随机变量与分布函数
上一章讨论独立时,我们反复问的是:“知道一件事发生,会不会改变另一件事的概率?”掷两枚骰子,第一枚是否出现 6、第二枚是否出现 6,都可以写成事件。可如果问题换成“两枚点数加起来是多少”,只用事件说话就开始显得费劲:和为 2 是一个事件,和为 3 又是一个事件,一直到 12,我们得逐个记录。
能不能先把“把两个点数相加”这条规则起个名字,再统一讨论它的取值?随机变量就是从这个需要里走出来的。后面要计算平均收益、波动大小,研究很多次观测的平均值,第一步都是把关心的数量定义清楚。
不过,这个名字很容易让人误会。“随机变量”听着像一个会随机变化的数,严格说,它首先是一个函数。这次概念转换值得慢一点:真正随机的是试验产生哪个结果;函数本身规定的是,同一个结果永远对应同一个数。先把这一点想清楚,分布、期望和极限定理才有明确的研究对象。
随机变量是一条确定的取数规则
一个结果,可以从不同角度取数
考虑依次抛两枚硬币,用 H 表示正面、T 表示反面。样本空间是
Ω={HH,HT,TH,TT}.
这里装的是完整结果:HT 说明第一枚正面、第二枚反面。它本身并不是“正面出现几次”的答案。为了回答这个问题,我们定义函数 X,把每个结果对应到正面个数:
X(HH)=2,X(HT)=1,X(TH)=1,X(T
当我们说“令随机变量 X 表示正面个数”,其实就是用一句话写下了上面四条规则。X 是整张对应表;X(HT)=1 是其中一条对应关系;试验后看到的 1 是一次观测值。三个对象相关,却不能混成一个。
同一个试验还可以定义另一个函数 Y:只记录第一枚是否正面,正面记 1,反面记 0。于是
Y(HH)=Y(HT)=1,Y(TH)=Y(TT)=0.
当结果是 TH 时,X 给出 1,Y 给出 0。没有矛盾,因为它们回答的是不同问题。我们也可以令 Z=X−Y,记录第二枚是否正面;它仍然是定义在同一样本空间上的函数。
随机变量通常会丢掉一部分原始信息。知道 X=1,我们只能判断结果是 HT 或 TH,无法恢复哪枚先出现正面。这个信息损失正是我们愿意接受的:如果只研究正面个数,就不必把硬币顺序一直带在计算里。
若再假定两枚硬币公平且相互独立,四种原始结果的概率就都是 1/4。沿着取数规则把概率一起送到数轴上,“正反”和“反正”汇到同一个值 1,因此这个值接住了 1/2 的概率。
随机的是试验结果,规则本身不变:正正映射到2,正反和反正都映射到1,反反映射到0;三个取值的概率依次为1/4、1/2、1/4。
随机在哪里,函数又为什么是确定的
函数的写法是
X:Ω⟶R,ω⟼X(ω).
试验发生前,我们不知道输入会是哪个 ω,所以不知道最后读到哪个数;但把 HT 输入 X,无论输入多少次,答案都是 1。随机性来自输入的概率安排,并不是函数临时改变了规则。
这里也没有要求现实中的试验必须能原样重复。明天某地的降雨量、某项未来任务的完成时间,都可以建立随机变量模型。样本空间描述我们考虑的可能情形,概率描述这些情形的权重,随机变量从每种情形中取出所关心的数。独立重复试验是以后研究长期平均时要额外说明的结构,并不包含在随机变量的定义里。
观测发生后,函数也不会消失。只是这一次的输入已经确定为某个 ω0,我们读到了 x=X(ω0)。以后说“随机变量服从某个分布”,是在讨论所有可能输入所形成的概率规律;说“这次观测到 x=1”,只是在报告其中一次结果。
数轴上的条件,怎样成为可以计算概率的事件
现在我们想求 P(X≥1)。概率 P 原本是给事件用的,X≥1 看起来却是一条关于函数值的不等式。它们怎么接上?
答案是,把这个条件翻译回样本空间:
{X≥1}={ω∈Ω:X(ω)≥1}={HH,H
所以 P(X≥1) 是一个省略写法,完整含义是“所有能被 X 映射到 [1,∞) 的样本点所组成的事件的概率”。若两枚硬币公平且独立,四个结果各有概率 1/4,于是答案是 3/4。公平和独立负责给原始结果分配概率; 的对应规则负责把它们归并到一起。
对数轴上的集合 B,这个动作写成
{X∈B}=X−1(B)={ω:X(ω)∈B
X−1(B) 读作 B 的“原像”。这里的 −1 并不意味着 X 存在反函数,也不要求它是一一对应。正面个数这个函数就没有普通意义的反函数,因为数值 1 对应两个原始结果;但集合 的原像完全清楚,就是 。
可测性是在保证每个概率问题都有意义
在有限样本空间里,如果所有子集都被允许当作事件,取原像后当然还是一个事件,因此任何实值函数都能这样使用。但前面学习概率空间时,我们已经把“允许赋予概率的事件”集中放在 F 里。一般模型中,不能假定任意子集都属于 F。
因此,随机变量的严格定义比“从样本空间到实数的函数”多一步:在概率空间 (Ω,F,P) 上,实值函数 X 要满足,对每个实数 x,都有
{ω:X(ω)≤x}∈F.
这叫作 X 的可测性。名字听起来像增加了一层抽象,要求其实很具体:我们一旦提出“X 不超过这个阈值吗”,被挑出来的样本点必须构成一个合法事件,否则 P(X≤x) 连定义都谈不上。
为什么只检查“不超过某个阈值”就够了?因为这些半直线能通过可数次并、交、补生成实数轴上的 Borel 集,而原像运算保留这些集合运算。例如
{a<X≤b}={X≤b}∖{X≤a},
{X<a}=n=1⋃∞{X≤a−1/n},
{X=a}={X≤a}∖{X<a}.
这些都是我们马上要计算概率的事件。更完整的说法是,对每个 Borel 集 B,都要求 X−1(B)∈F;对实值函数,这与上面的阈值条件等价。
可以用一个很小的模型看看,这个要求不是空话。设 Ω={a,b,c,d},但事件集合只有
F={∅,Ω,{a,b},{c,d}}.
这个模型只能区分“结果在前一组还是后一组”。若令 X(a)=X(b)=0、X(c)=X(d)=1,它是可测的,因为任何阈值只会挑出空集、前一组或整个空间。若改成 、其余结果都记 ,则 不在 中。 依然是一条函数,却不是这个概率空间上的随机变量。我们不能要求现有的概率模型回答它根本没有定义的问题。
平常题目中的计数、和、差、最大值,以及实值随机变量经过连续函数得到的数量,都能在合适的概率空间上构成随机变量。初学时不必每次重新证明可测性,但要知道它负责让“关于数值的条件”成为“能够赋予概率的事件”。
把事件本身写成一个数
对任意事件 A∈F,定义指示随机变量
1A(ω)={1,0,
它只回答“这件事发生了吗”。掷两枚骰子时,令 A 为“至少一枚出现 6”,那么 I=1A 满足
P(I=1)=P(A)=1−(6
这里我们把上一章的独立性用于“两个骰子都不出现 6”,再用补事件计算。指示变量让事件和数字接在一起,后面“发生了多少次”可以写成许多个 0、1 的和,“发生的比例”可以写成它们的平均值。大数定律最终要解释的频率,就是这样的平均值。
分布:把数值与概率打包起来
我们已经有了函数 X,为什么还需要“分布”?因为知道对应规则,并不等于知道每个输出有多大概率。刚才那张正面个数的对应表,对偏硬币同样成立;一旦硬币的正面概率改变,X 的分布就会改变。
反过来,不同试验也能产生相同的数值概率规律。例如,一枚公平硬币正面记 1、反面记 0;另一个设备以各 1/2 的概率显示“开”或“关”,分别记 1、0。两个试验的原始结果完全不同,但若只问“输出为 0 或 1 的概率”,两边得到同一张表。
分布就是把这份数值概率信息单独拿出来。对实数轴上的 Borel 集 B,定义
μX(B)=P(X∈B).
μX 是数轴上的概率分布。原先 P 给样本空间的事件分配概率,现在 μX 给数轴上的集合分配概率。它没有另造一套权重,只是把原有权重按照 X 的取值汇总。
这份新安排确实仍然满足概率公理。整个实数轴对应整个样本空间,所以 μX(R)=1;不交的数值集合,对应的原像也不交,因此概率可以相加。只要研究的是 X 本身取值的概率,就可以用 μX 计算,不必每次回到原始样本点逐个数。
同分布,不代表是同一个随机变量
两个随机变量对所有数值集合给出相同概率,就叫同分布,记为
X=dY.
但别把这句话扩大成“在所有概率问题上它们都一样”。分布只记录一个变量单独的取值规律,不记录它怎样与别的变量一起出现。
在同一次公平硬币试验上,令 X 为“正面记 1、反面记 0”,再令 Y=1−X。它们都以各 1/2 的概率取 0、,所以同分布;可是每次试验它们都不相等,而且
P(X=1,Y=1)=0.
如果另取 Z=X,Z 也有相同的分布,但这次
P(X=1,Z=1)=21.
再扩展试验,独立抛第二枚公平硬币,用 W 记录它是否正面。W 仍然是同样的 0、1 分布,却有
P(X=1,W=1)=41.
三位“同分布的伙伴”与 X 同时取 1 的概率分别是 0、1/2、1/4。所以上一章的独立性不能被一个分布名称替代。以后只给出 X 与 Y 各自的分布,如果题目问 的分布,往往还缺少它们的联合关系。
用一个函数记录整份分布
直接给每个集合 B 写出 P(X∈B) 太繁琐。我们希望找到一种更紧凑的记录方法:只问一种形状的集合,却足以恢复全部分布。累积分布函数正好做到这一点。
定义
FX(x)=P(X≤x),x∈R.
这里大写 X 是随机变量,小写 x 是由我们移动的阈值。固定阈值 x 后,FX(x) 是一个确定的概率数字。例如 F 问“不超过 的概率”; 问“不超过 的概率”。即使 从不取 ,后一个问题仍然有意义。
把阈值从左向右移动,相当于沿数轴把已经经过的概率累计起来。这也是它叫累积分布函数、简称 CDF 的原因。对前面公平独立硬币的正面总数,
FX(x)=
例如 x=1.7 时,满足条件的取值仍然只有 0、1,所以 FX(1.7)=3/4。CDF 在没有新增概率的地方保持水平,到有概率质量的点才向上跳。
CDF 的三个基本性质都有事件依据
首先,CDF 单调不下降。如果 x<y,那么“X 不超过 x”发生时,“X 不超过 y”也一定发生,即
{X≤x}⊆{X≤y}.
概率的单调性便给出 FX(x)≤FX(y)。所以一条哪怕只有局部下降的曲线,都不可能是 CDF。它也不必严格上升:没有概率落在某个区间里,累计量就在那段保持不变。
其次,两端的极限必须是
x→−∞limFX(x)=0,
为什么最右边会把概率收齐?因为本章定义的是实值随机变量,每个 X(ω) 都是有限实数。当整数 n 增大时,事件 {X≤n} 逐渐扩张,它们的并集是 Ω。由概率对递增事件列的连续性,F。另一方面, 逐渐缩小,交集为空,于是 。再用单调性,就得到对实数阈值的两个极限。
“趋近 1”并不要求在某个有限位置已经等于 1。例如一个可以取任意大的正整数、但大值概率越来越小的变量,可能对每个有限 x 都有 FX(x)<1。这不会漏掉概率,只是总概率要在无限向右的极限中收齐。
第三,CDF 必须右连续:
h↓0limFX(x+h)=F
先固定一个 x,看事件列
An={X≤x+1/n}.
阈值逐渐下降,An 也逐渐缩小。如果 X(ω)≤x,这个样本点会一直留在里面;如果 X(ω)>x,那么差值 是正的,只要 足够大, 小于这个差值,它就会被排除。因此
An↓{X≤x}.
由概率对递减事件列的连续性,
n→∞limFX(x+1/n)
单调性又保证,其他从右边靠近 x 的阈值也得到同一极限:当 0<h<1/n 时,FX(x)≤,两边一起夹向 。右连续性就证明出来了。
这不是为了画阶梯图临时订的一条规则。它来自“≤ 把端点算进去”,以及概率公理已经保证的事件列连续性。过去凭图像记住的性质,现在有了明确依据。
左极限为什么可能不等于函数值
让阈值从左边靠近 x,事件变成
{X≤x−1/n}↑{X<x}.
这里的并集不包含 X=x 的样本点:无论 n 多大,x−1/n 都还小于 x。所以
FX(x−):=t↑xlimF
把它与 FX(x)=P(X≤x) 相减,恰好剩下端点的概率:
P(X=x)=FX(x)−FX(x
因此,CDF 在一点跳了多高,那一点就有多大的概率。硬币正面总数的 CDF 在 1 处从 1/4 跳到 3/4,跳幅为 1/2,正好等于 P(X=1)。画图时,x 处的实心点应该在 ; 是左侧靠近时的高度,应在旧台阶右端画空心点。连接上下台阶的辅助竖线只是提示跳跃,不表示同一个 有一整段函数值。
从 CDF 取回区间概率
CDF 已经累计了左边的一大块概率。要留下中间一段,最自然的办法是做减法。对 a<b,
{X≤b}={X≤a}∪˙{a<X≤b},
其中点并号表示不交并。因此
P(a<X≤b)=FX(b)−FX
这里左端点不包含、右端点包含,完全由这次集合拆分决定。若左端点也要保留,就应减去 P(X<a)=FX(a−)。四种区间对应关系可以放在一起看:
不用把表硬背下来。看上界是否包含端点,决定用 FX(b) 还是 FX(b−);再看下界要排除哪部分。类似地,右尾概率为
P(X>x)=1−FX(x),P(X≥
用硬币总数检查一次:P(0<X≤1)=3/4−1/4=1/2;而 P(0≤。左端点的一个小小等号,在这里改变了 的概率,不能凭习惯忽略。
CDF 能恢复所有这些区间概率,而数轴上的 Borel 概率分布由这类区间的概率唯一确定。所以两个变量的 CDF 处处相等,就足以判断它们同分布。它仍然没有告诉我们两个变量在同一次试验中如何配对,这与前面“同分布不确定联合关系”的结论是一致的。
满足这些条件的函数,真的能成为 CDF 吗
我们已经证明,一个 CDF 必须单调不下降、右连续,并且在负无穷和正无穷分别趋于 0 和 1。这三项也足够:任意满足它们的函数 F,都能成为某个实值随机变量的 CDF。
可以直接构造一个变量来说明。取一个在 (0,1) 上均匀分布的随机变量 U,把它看成随机选中的“累计概率高度”。对 0<u<1,定义
Q(u)=inf{x:F(x)≥u}.
也就是从左向右找,累计概率第一次达到高度 u 的位置。两端极限保证这个位置有限;单调性与右连续性保证,下确界位置也已达到该高度。因此
Q(u)≤x⟺u≤F(x).
令 V=Q(U),上面的等价关系一方面说明 {V≤x}={U≤F(x)} 是事件,另一方面给出
P(V≤x)=P(U≤F(x))=F(x).
于是 V 的 CDF 确实就是 F。这里的 Q 叫广义分位数函数:即使 F 有水平段或跳跃、不存在普通反函数,这个构造仍然可用。它也解释了计算机为什么能从一个均匀随机数出发,生成其他分布的数值。我们会在随机变量变换时继续使用这个想法。
离散分布:把同一个数背后的概率加起来
如果存在一个有限或可数无限的集合 S,使得 P(X∈S)=1,我们称 X 为离散随机变量。通常题目直接给出它的所有可能取值,此时可把它们组成 S。更严格的表述允许在零概率事件上还有其他取值;这些取值不会改变分布。
离散变量适合逐点记录概率,定义概率质量函数,简称 PMF:
pX(s)=P(X=s),s∈S.
每一项非负,总和为 1:
pX(s)≥0,s∈S∑pX
对于有限样本空间,它来自一个很明确的汇总动作:
pX(s)=ω:X(ω)=s∑P({ω}).
所以,原始样本点等可能,不代表随机变量的取值等可能。有的输出背后挤着很多原始结果,有的输出只对应一个;汇总后的权重当然不同。
两枚骰子的点数和
设两枚骰子公平且独立,结果写成有序对 (i,j)。共有 36 个等可能结果,每个概率都是 1/36。令 S=i+j。固定 s 后,我们要数满足 、 的有序对,而不是数“可能的和一共有几个”。
当 s=2,3,…,7 时,第一枚可以从 1 取到 s−1,共有 s−1 种;当 时,两枚都不超过 的限制逐渐排除选项,只剩 种。因此
pS(s)=
这些分子依次是 1,2,3,4,5,6,5,4,3,2,1,加起来是 36,归一化正确。和为 7 的概率是 ,并不是把 个可能的和平均分配后得到的 。
CDF 则把 PMF 累计起来:
FS(x)=s≤x∑pS(s
例如 FS(5)=(1+2+3+4)/36=10/36,,于是
P(5<S≤8)=FS(8)−F
也可以直接加 s=6,7,8 的概率,得到 (5+6+5)/36。两种方法算的是同一组原始结果,这种交叉核对能及时发现端点有没有多算或少算。
可数无限取值的处理没有换一套逻辑,只是有限和变成无穷级数。例如 P(N=n)=2−n,n=1,2,…,总和是 1;对正整数 ,。每个有限阈值都还漏着一点尾部概率,但阈值趋于无穷时遗漏趋于 。下一章的等待次数模型会让这条级数有具体的试验解释。
密度:区间里的概率有多集中
现在换成等待时间。假设某种等待时间 T 在 0 到 10 分钟之间均匀分布。这个假设说的是:位于这个范围内、长度相同的两个区间,获得相同的概率。它没有说“每个精确时刻都有一个相等的正概率”。如果每个点都分到相同的正概率,光是挑足够多个点,总概率就会超过 1。
这个模型把概率按长度分配,因此长度为 3 分钟的区间概率是 3/10。可以用一个高度为 1/10 的函数表达这种分配方式:
fT(t)={1/10,0,
区间概率等于曲线下方的面积:
P(4<T≤7)=∫4710
一般地,如果存在非负可积函数 fX,使得
FX(x)=∫−∞xfX
对所有实数 x 成立,就称 X 有概率密度函数,简称 PDF。这时分布叫作绝对连续分布。后面常见连续分布主要研究这一类。
密度满足
fX(x)≥0,∫−∞∞f
而任意区间的概率可由积分得到。对等待时间,完整 CDF 为
FT(t)=⎩
写出支持范围外的 0 和 1 很有必要;若只写 FT(t)=t/10 而不限制范围,负时间会得到负概率,超过 10 分钟又会得到大于 1 的概率。
为什么密度高度不是点概率
有密度时,CDF 连续,因此每个单点的概率都是
P(X=x)=FX(x)−FX(x
这个结论不需要加“通常”两个字:对有密度的随机变量,每个单点概率确实都是 0。但零概率不等于事件为空。均匀模型允许 T=4,只是这个单点没有长度;模型把正概率分配给区间,而没有给单点分配正质量。
这也没有与“所有可能值总共概率为 1”冲突。概率公理保证的是可数可加性,我们不能把一个实数区间拆成不可数多个单点,再把普通无穷级数的求和规则直接套过去。把区间切成有限或可数个小区间时,可加性仍然正常工作。
密度甚至可以大于 1。例如均匀分布在 (0,1/4) 上的变量,密度是 4,但整个面积为 4×1/4=1;落在长度 0.02 的内部区间里的概率是 。高度越大,表示相同短区间里概率越集中,不表示单点有超过 的概率。
若 fX 在 x 处连续,那么对足够小的正数 h,
P(x<X≤x+h)=∫xx+h
右边的 h 不能漏掉。如果 X 用分钟计量,密度的单位就是“每分钟”,乘上区间的分钟数才得到无单位的概率。这个单位检查也能提醒我们:密度高度和概率本来就是不同的量。
积分与求导之间,哪些条件不能省
从密度得到 CDF 用积分;从 CDF 得到密度常用求导。在密度连续的点,微积分基本定理给出
FX′(x)=fX(x).
一般的可积密度只保证这个等式几乎处处成立,也就是允许在一个长度为零的集合上例外。密度本身也不是逐点唯一的:改动某一个点的高度,不会改变任何积分,因此不会改变分布。CDF 则对每个 x 都有确定值。
所以不要把“只要 CDF 可导就能在每一点恢复预先指定的密度值”当作无条件规则。我们后面遇到的分段密度,在拼接点用哪一个高度通常不影响概率;真正应检查的是各段积分以及 CDF 能否正确衔接。
下面的演示换用另一种有密度的模型:f(x)=λe−λx,x≥0,其中 λ>0;负数范围的密度为 。把它从 积分到 ,得到 。我们稍后会专门研究这种指数分布,这里先用它核对“面积等于累计量之差”。
先保持参数不变,只移动区间右端点,比较左图的阴影面积和右图的竖直高度差。再把两个端点移到一起,区间概率就变为 0,即使端点处的密度仍然为正。调大 λ 后,左图起始高度可以超过 1,而概率读数始终在 0 与 1 之间。图只显示 0 到 8 的范围,右边未画出的尾部仍有概率;“总面积为 1”指整个非负实数轴上的积分。
这三种函数并不是每个随机变量都同时拥有。CDF 总是存在;纯离散分布用 PMF;绝对连续分布用 PDF。下面这个例子就不能只靠一张 PMF 或一个普通 PDF 讲完。
一部分概率在点上,一部分铺在区间里
设某个服务窗口有 30% 的概率可以立即办理,等待时间 T=0;其余 70% 的情况下需要排队,并假设给定“需要排队”后,等待时间在 0 到 10 分钟之间均匀分布。
这不是“有 30% 的人恰好等到零附近”的连续近似。模型明确把 0.3 的概率放在精确的 0 上,其余概率才按区间长度铺开。由前面学过的全概率公式,当 0≤t≤10 时,
P(T≤t)=P(立即办理)+
所以它的 CDF 是
FT(t)=⎩
在 0 处,CDF 从 0 跳到 0.3;从 0 到 10,再沿直线增加到 1。这叫作离散成分与绝对连续成分的混合分布。
同一个 CDF 可以直接处理端点和区间:
P(T=0)=0.3,P(0<T≤3)=F
P(T≤3)=0.51.
后两个概率相差 0.3,差的正是无需等待的那一组。如果只对 FT 的普通上升部分求导,会得到 0.07;在 (0,10) 上积分却只有 0.7。剩下的 藏在跳跃里,不能用单个点的普通函数高度补回来,因为任何有限的单点高度都没有面积。这个分布没有覆盖全部概率的普通 PDF。
对任何 Borel 集 B,它完整的概率安排可以写成
P(T∈B)=0.31{0∈B}+∫
第一项处理 B 是否包含原子点 0,第二项处理区间部分。在后面的条件分布、截断和变换问题里,这种“一个点加一段连续部分”的结构还会出现。遇到它时直接回到 CDF,通常比勉强寻找一个纯离散或纯连续的标签更省事。
CDF 连续,也不一定存在密度
我们已经知道:有密度,一定没有跳跃;没有跳跃,说明所有单点概率都是 0。能否倒过来说,没有跳跃就必然有密度?不能。
可以这样理解一个边界例子。独立生成一串公平的 0、1 变量 B1,B2,…,令
C=n=1∑∞3n2B
它的三进制数字只能是 0 或 2,因此取值落在不断删除中间三分之一后留下的集合里。保留到第 n 步时,共有 2n 个区间,每段长度是 3−n,总长度为 ;继续下去,最终留下的集合长度为 。
但变量 C 的全部概率都在这个集合上。同时,指定一个具体取值需要指定无限串数字,前 n 个数字同时吻合的概率只有 2−n,它趋于 0,所以每个单点的概率都是 0。于是 CDF 连续,却不可能有普通密度:如果存在密度,对长度为零的集合积分应当得到 0,而这里那个集合的概率是 。
我们不会在入门计算里大量使用这类奇异连续分布,但它指出了一个必要的逻辑边界:“CDF 连续”“单点概率全为零”“存在密度”不是三句可以随意互换的话。前两者等价;存在密度是更强的条件。本课程后面提到常见连续分布时,会明确使用有密度的模型。
从实际问题写出可以使用的模型
现在回头看“令 X 表示某个量”这句话,它其实压缩了好几项工作。先要弄清完整结果是什么,再规定从结果里取哪个数,最后说明哪些概率信息来自假设、哪些来自计算。
比如一个网站记录用户点击按钮的时间。若只关心是否在 5 秒内点击,可以定义 I=1{5 秒内点击};没点击的人取 0,数值规则没有遗漏。若直接说“T 是点击等待时间”,却允许用户永远不点击,就还欠着一个定义:对那些结果, 究竟取什么值?
一种办法是只研究给定“最终会点击”后的等待时间,但这时分布是条件分布,研究对象已经改变。另一种办法是固定观察窗口,比如 60 秒,把变量定义为“点击时间与 60 秒的较小者”,未点击也记 60。这个变量是有限实值的,但在 60 秒处可能出现一块正概率质量,因此未必有纯粹的连续密度。
也可以允许扩展实值 +∞ 表示永不点击,不过这超出了本章的有限实值约定;如果 P(T=+∞)>0,那么对有限阈值定义的 FT(t) 在 时就只能趋于 ,不再趋于 。这正解释了前面证明 CDF 两端极限时,为什么明确使用“每个输出都是有限实数”。
这些区别不是记号上的挑剔。一个截止时刻积累起来的点概率,可能改变阈值事件的计算;删掉未点击者,则会改变我们分析的总体。写模型时把这些问题交代清楚,后面的积分和求和才是在回答同一个问题。
把概念放回计算里
练习:同一结果的两种记录
抛两枚公平且独立的硬币。令 X 为正面个数,令 J 为“两枚结果相同”的指示变量。写出 J 在四个样本点的取值,求 P(J=1),并判断 J 是否可以写成 X 的函数。
在 HH,HT,TH,TT 上,J 依次取 1,0,0,1,所以 。两枚结果相同恰好对应正面个数为 或 ,因此
练习:端点究竟带走多少概率
已知 Y 的概率质量为 P(Y=−1)=0.2、P(Y=2)=0.5、。写出完整 CDF,求 、 和 。
从左向右累加,得到
FY(y)=
练习:一条曲线是否能作 CDF
考虑函数 G(x):当 x≤0 时为 0,当 0<x<1 时为 0.4+,当 时为 。它单调不下降,两端极限也正确,能否作为某个实值随机变量的 CDF?怎样只改一个点就使它成为合法 CDF?
不能,因为 G(0)=0,但从右边靠近 0 时,极限为 0.4,它不右连续。把 G(0) 改成 0.4 后,三个基本条件都成立。这时 0 处有概率质量 ,而 内的连续部分密度为 。这里单点修改会改变 CDF 的合法性,与“单点修改密度不改变分布”正好形成区别。
练习:密度、CDF 与短区间
设 Z 的密度为 fZ(z)=3z2,0<z,其他位置为 。验证归一化,求完整 CDF、 和 。在 附近长度为 的右侧区间中,用密度给出概率的近似值。
归一化由 ∫013z2dz=1 得到。积分给出
练习:同样的分布,能否直接求和
随机变量 A、B 都以各 1/2 的概率取 0 和 1。仅凭这条信息,能否求出 P(A+B=1?分别在 、、 与 独立时计算。
不能唯一确定。如果 B=A,和只可能是 0 或 2,所求概率是 0;如果 B=1−A,和恒等于 ,所求概率是 ;如果两者独立, 对应 或 ,概率是 。
接下来,我们给常用的计数规则写出分布
现在看到 P(X≤x),我们可以把它完整地展开:先在样本空间上有一条可测的取数规则 X,再用阈值 x 选出事件,最后由概率给这个事件赋值。分布把这些数值事件的概率组织起来,CDF 用一种统一的累计方式记录它们。
下一章把注意力放到离散变量:一次成败、固定次数中的成功总数、等到成功所需的次数、无放回抽样中的命中数。它们看起来都在“数个数”,对应的函数和试验结构却不同。我们会从这些区别推导常见分布的公式,而不是先拿一个名字去套题目。以后研究平均值是否稳定时,再回头看今天的指示变量:把事件是否发生记成 0 和 1,正是把频率写成随机变量平均值的起点。