概率不等式、收敛概念与大数定律
上一章把随机变量的分布装进生成函数和特征函数,让独立随机变量的求和变得容易处理。我们现在再往前走一步:如果加起来的变量越来越多,能不能不去求每一个和的完整分布,就判断它们的平均值最后会怎样?
这其实是在回头回答学概率时就遇到的问题。刚开始,我们常听到“正面概率是 p,扔很多次以后,正面比例就会接近 p”。当时,这句话帮助我们理解概率;但在已经建立的数学模型里,p 是给定的概率,频率是由整串随机结果算出来的随机变量。给定的概率为什么能控制观察到的频率,需要证明。
先把期待放准:大数定律不会承诺第 1000 次以后频率永远不再偏离,也不会让下一次硬币替前面的结果“补账”。它要建立的是一种严格的长期稳定性。为此,我们先学会把均值、方差这些有限的信息变成概率上界,再弄清楚随机变量“趋近”究竟有几种意思。
不知道完整分布,仍然能说些什么
假设某台设备一次维修的费用记为 L。我们知道费用非负,平均每次是 180 元,但不知道它是多数时候很便宜、偶尔特别贵,还是每次都在 180 元附近。现在有人问,一次花费至少 900 元的概率有多大。
这些信息不足以算出一个唯一答案。每次恰好花 180 元,满足已知条件,大额维修概率却为 0;以 20% 的概率花 900 元,其余时候不用花钱,也满足平均 180 元,此时大额维修概率为 20%。我们能争取的,是找出所有符合条件的分布都必须遵守的限制。
这就是概率不等式的工作方式。等式回答“准确是多少”,上界回答“最多能有多大”。上界很小时,即便不知道更多细节,也能排除大概率发生坏情况的可能;上界很大时,只能说明现有信息还不够有力。
以后遇到一个概率上界,我们都要区分三个数:事件的真实概率、由不等式得到的理论上界、有限次模拟中观察到的发生比例。真实概率由模型决定,上界由我们掌握的信息决定,模拟比例还带着模拟本身的随机误差。三者不能混用。
Markov 不等式:均值给大数值划出预算
从维修费用看懂公式
继续看非负维修费用 L。一次费用只要达到 900 元,就至少为平均费用贡献“900 乘以这类情况的概率”。其他费用都非负,不可能抵消这部分贡献,所以
E[L]≥900P(L≥900).
平均费用只有 180 元,于是
P(L≥900)≤900180=0.2.
这个推理没有使用密度、分布名称,甚至没有要求变量是离散型还是连续型。它只依靠非负性和期望。
一般地,若 X≥0 几乎必然成立,且 E[X]<∞,那么对任意 a>0,都有 Markov 不等式:
P(X≥a)≤aE[X].
这里的 a 是阈值。固定均值以后,阈值越高,上界越低;但这没有说概率恰好按 1/a 下降。它只规定概率不能超过这条限制。
用指示变量写出完整证明
我们在期望一章学过,事件的指示变量把“是否发生”变成 0 或 1,而且
E[1A]=P(A).
令 A={X≥a}。对每一个结果分别检查:如果 A 发生,a1A=a≤X;如果 不发生,。因此逐点有
a1{X≥a}≤X.
期望保持大小关系,两边取期望便得到
aP(X≥a)≤E[X].
再除以正数 a,证明完成。这也是一个以后会反复用到的办法:先在每个结果上建立不等式,再用期望把结果层面的关系汇总成概率关系。
为什么非负性不能省
设 X 以各一半的概率取 −4 和 4。此时 E[X]=0,但 P(X≥4)。如果忘记非负条件,直接套公式就会错误地得到 。问题出在负值把均值抵消了:均值很小,不代表正的大值很少。
变量可以为负时,我们常改看 ∣X∣、X2 或其他非负函数。例如只要 E[∣X∣r]<∞,其中 ,就能对 使用同一证明:
P(∣X∣≥a)=P(∣X∣r≥ar
这条式子把“控制尾部”与“知道某一阶矩”联系起来。稍后证明强大数定律的一个版本时,我们会用到 r=4。
上界什么时候有用,什么时候能取到
概率本来就不超过 1,所以实际使用时可以写成
P(X≥a)≤min{1,aE[X]}.
如果 E[X]=180,却问 P(X≥90),原公式给出 2。这不是出现了“200% 的概率”,而是这条不等式没有提供比 P 更强的限制。
另一方面,前面的维修模型已经说明 20% 的上界确实可以达到。一般地,给定 0≤m≤a,令 X=a 的概率为 m/a,其余概率取 0,便有 ,并且 。因此,
Chebyshev 不等式:方差到底能控制多大偏差
Markov 控制的是非负变量的大数值。若我们关心一次测量离真实均值有多远,真正要观察的是 ∣X−μ∣。它可能往左偏,也可能往右偏,两边都应该计入。
方差恰好测量了偏差平方的平均值:
Var(X)=E[(X−μ)2],μ=E[X].
所以,只要方差有限,我们就能让上一节的证明直接工作。
证明只需要换一个非负变量
设 E[X]=μ,Var(X)=σ2<∞。固定容许误差 ε>,由于平方在非负数上保持大小关系,
{∣X−μ∣≥ε}={(X−μ)2≥ε
对 (X−μ)2 用 Markov 不等式,就得到 Chebyshev 不等式:
P(∣X−μ∣≥ε)≤ε2E
读这条式子时,要看清 ε 的位置:允许区间是 (μ−ε,μ+ε),从均值到任一边界的距离是 ε,整个区间的宽度是 2ε。不等式控制的是落在这个区间之外、包括边界的总概率。
如果 σ>0,把阈值写成 k 个标准差便有
P(∣X−μ∣≥kσ)≤k21,
例如偏离至少 3 个标准差的概率不超过 1/9。这个结论没有正态假设。正态变量的同一概率约为 0.0027,比 1/9 小很多,说明知道完整分布可以提供更精细的信息。如果 σ=0,变量几乎必然等于 μ,应直接得到所有正阈值下的偏离概率为 ,不需要做除以 的操作。
保守不等于随意放大
设某种误差 X 的均值为 0,方差为 9。对于至少 6 个单位的误差,
P(∣X∣≥6)≤369=41
这 1/4 能否真的取到?可以。让误差以 1/8 的概率取 6,以 1/8 的概率取 −6,以 3/4 的概率取 0。它的均值为 ,二阶矩为
36⋅81+36⋅81=9,
而且 P(∣X∣≥6)=1/4。因此,不等式的保守来自它要同时容纳这些极端分布,并不是证明随手估大了一截。
方差更小,会给同一误差阈值提供更小的 Chebyshev 上界,但仅凭两个方差的大小,不能比较两个具体分布的真实尾概率。均值、方差信息没有记录概率在各处如何分配。
还有一个细节:方差为无穷时,不能拿这条式子得到趋于零的有限上界。这意味着当前证明工具失效,不意味着后面的大数定律一定不成立。我们会看到,有限期望已经足以支撑独立同分布情形下的强大数定律。
Jensen 不等式:平均与变换为什么不能随便交换
前两条不等式比较的是概率和矩。这一条先回答另一个常见疑问:既然期望是平均,为什么不能把 E[g(X)] 都写成 g(E[X])?
设 X 以相同概率取 1 和 5。先平均得到 3,再平方得到 9;先平方得到 1 和 25,再平均得到 13。差出来的 ,正是这个变量的方差。平方把偏离平均的部分也计入了结果。
但换一个函数,方向未必相同。对正数取对数时,“先变换再平均”反而不大于“先平均再变换”。决定方向的是函数的凸性或凹性。
从两点平均到任意分布
函数 g 在一个区间 I 上是凸的,意思是对 x,y∈I 和 0≤t≤1,都有
g(tx+(1−t)y)≤tg(x)+(1−t)g(y).
左边先平均横坐标,再到曲线上找高度;右边先找两端的高度,再按同样的权重平均。图形上,两端连成的线段在曲线上方或与曲线重合。
对只有两个可能取值的随机变量,这个定义本身就是 Jensen 不等式。对一般随机变量,结论是:如果 X 几乎必然落在 I 内,g 在 I 上是有限值凸函数,且 E[∣X∣]<∞、,则
g(E[X])≤E[g(X)].
我们先采用两边都是有限数的版本,便于直接计算。对凸函数还可以讨论右侧为 +∞ 的扩展版本;那时不等式可能仍然成立,却没有给出有限的数值估计。不能把“缺少有限矩”一概说成公式为假。
支撑直线给出一般证明
令 m=E[X]。先设 m 位于 I 的内部。凸函数在 m 处可以找到一条从下方托住图像的直线:存在一个有限斜率 s,使得对所有 x∈,
g(x)≥g(m)+s(x−m).
如果 g 在这里可导,可以取 s=g′(m);不可导时,可以在左导数与右导数之间选一个斜率。为什么能这样选?凸性使割线斜率按横坐标的次序递增,于是左侧割线不会要求斜率比右侧还大,两者之间存在一个能同时照顾左右的斜率。
把 x 换成 X 并取期望:
E[g(X)]≥g(m)+sE[X−m]=g(m).
最后一项消失,是因为 m 就是均值。这就证明了 Jensen 不等式。证明中真正起作用的,是“线性部分在均值处相互抵消,而凸函数始终在支撑直线上方”。
若 m 恰好是取值区间的有限端点,也不会漏掉结论。例如 X≥m 且 E[X]=m,则非负变量 X−m 的期望为 0,从而 几乎必然成立,不等式成为等式。另一端点同理。
几个可以马上使用的结果
取 g(x)=x2,在二阶矩有限时得到
(E[X])2≤E[X2].
取 g(x)=∣x∣,在 X 可积时得到
∣E[X]∣≤E[∣X∣].
取 g(x)=ex,在 X 和 eX 都可积时得到
eE[X]≤E[eX].
这里不要把“指数函数有定义”误认为“指数函数的期望有限”。函数可以对每一个有限输入都给出有限值,但将它按某个重尾分布平均后仍可能发散,上一章矩母函数的存在区间已经展示过这个问题。
对于凹函数 h,函数 −h 是凸函数,所以不等号反向。若 X>0 几乎必然成立,E[X]<∞ 且 E,就有
E[logX]≤logE[X].
例如一个正的倍率以各一半概率取 1/2 和 3/2,平均倍率是 1,但平均对数倍率为
21log21+
这揭示了按乘法累计时需要关心的量,但它本身并没有说明一串倍率的长期表现。要把平均对数与长期实际平均联系起来,还需要后面的大数定律。
当 g 严格凸、相关期望有限时,Jensen 取等号当且仅当 X 几乎必然为常数。非严格凸时则可能有更多等号情况,例如 g 在变量的取值区间上恰好是线性的。应用时先检查定义域,再判断凸凹,最后检查期望,方向就不容易记反。
随机变量趋近,究竟是哪一种趋近
普通数列 an→a 的意思是:给定任何固定的小误差,走得足够远,后面的数都落在误差范围内。随机变量多了一层:同一个 n,不同结果 ω 会给出不同的 Xn。现在是要求每个结果都靠近,还是大多数结果靠近?只看分布靠近,又够不够?
为了看清差别,先约定:讨论依概率、几乎处处和均方收敛时,Xn 与 X 都定义在同一个概率空间上,所以 Xn−X 有意义。依分布收敛只比较各自的分布,可以不要求它们共享一个概率空间。
依概率收敛:固定时刻的坏情况越来越少
若对每一个 ε>0,都有
P(∣Xn−X∣>ε)⟶0,
就称 Xn 依概率收敛到 X,记为 XnP。
把某个 n 想成一次截面:在所有可能结果中,数一数有多大概率的结果偏离了目标超过 ε。这个概率趋于零,就是定义。不同 n 的坏结果可以不是同一批,因此单看每次坏结果很少,还不能断言某一个固定结果以后只会坏有限次。
“对每个固定 ε”也很关键。先选定误差,再让 n 越来越大;不能擅自把误差同时换成 1/n,然后声称新事件的概率也一定趋于零。
几乎处处收敛:沿一条路径一直往后看
若
P({ω:n→∞limXn(ω)=
就称 Xn 几乎处处收敛到 X,也称几乎必然收敛,记为 Xna.s.。
这次把 ω 固定,沿着 X1(ω),X2(ω),… 一直看下去。除了一个概率为零的例外集合,得到的普通数列都要收敛。
对这些收敛路径,每给定 ε>0,存在一个起点 N(ω,ε),使所有 n≥N(ω,ε) 的误差都小于 ε。这个起点通常依赖路径,不能换成一条适用于所有可能路径的固定有限期限。概率为零的例外也可能不是空集。
均方收敛:把偏差的大小也算进来
对二阶可积的 Xn 和 X,若
E[(Xn−X)2]⟶0,
就称 Xn 均方收敛到 X,记为 XnL。
它除了在乎出错的概率,还在乎出错时错得有多远。很小的概率乘上很大的平方误差,也可能贡献出不可忽略的平均平方误差。这使均方收敛比依概率收敛多了一层量值控制。
依分布收敛:只问分布函数是否靠近
记 Fn 和 F 分别为 Xn、X 的分布函数。若在 F 的每一个连续点 ,都有
Fn(x)⟶F(x),
就称 Xn 依分布收敛到 X,记为 Xnd。
这里必须保留“连续点”三个字。例如确定性的 Xn=1/n 当然趋向常数 0,其分布也应该趋向集中在 0 的分布。可是在 x=0,始终有 ,而极限分布满足 。跳跃点不要求收敛,正是为了容纳概率质量逐渐移向那个点的情况。
依分布收敛不要求密度存在,也不要求密度逐点收敛。下一章中心极限定理允许离散的标准化计数趋向连续正态分布,依据的就是分布函数意义下的收敛。
哪些收敛能推出哪些收敛
四个定义记住以后,更有用的是知道何时可以把一种结论换成另一种。基本关系如下。
均方收敛和几乎处处收敛之间,一般没有互相推出的关系。表里的前两行是两条分别通往依概率收敛的路线,不能把它们接成一条强弱直线。
先把能够普遍成立的箭头放在一起,接下来逐条解释它们为什么成立。图中的箭头只表示蕴含,不能任意倒过来使用;“极限为常数”是依分布收敛能够反推依概率收敛的一种特殊情况。
均方收敛与几乎处处收敛一般不能互推,但都能推出依概率收敛;依概率收敛又能推出依分布收敛。当极限为常数时,依分布收敛也能推出依概率收敛。
均方为什么推出依概率
固定 ε>0,对非负变量 (Xn−X)2 用 Markov 不等式:
P(∣Xn−X∣>ε)≤ε
这里分子是均方误差,不必等于误差的方差;当误差的均值不为零时,两者并不相同。因此直接说“对误差平方用 Markov”最清楚。
几乎处处为什么推出依概率
固定 ε>0,定义从第 m 步起“至少还会出现一次大误差”的事件
Bm=n≥m⋃{∣Xn−
随着 m 增大,Bm 递减。若路径收敛,大误差只能出现有限次,因此
m=1⋂∞Bm={∣X
的概率为 0。由递减事件的概率连续性,P(Bm)→0。而当 n≥m 时,单次大误差事件包含在 B 中,所以它的概率也趋于零。
这里可以看到强弱的区别:依概率收敛只控制第 n 次本身,几乎处处收敛还能在概率意义上控制整个后续阶段是否继续反复出现固定幅度的大误差。
依概率为什么推出依分布
取任意 δ>0。当 ∣Xn−X∣≤δ 时,如果 X≤,就一定有 ;反过来,如果 ,就一定有 。于是
F(x−δ)−P(∣Xn−X∣
先让 n→∞,两边的偏离概率趋于零;再让 δ↓0。如果 x 是 F 的连续点,上下两端都趋向 F(x),便得到 。
至于表中最后一行,假设 Xndc,其中 c 是常数。对任意 , 和 都是极限分布的连续点,所以
P(∣Xn−c∣>ε)≤Fn
这是一条特殊的反向关系。目标只有一个确定数值时,“分布挤到这个点附近”就足以控制变量与这个数的距离;一般随机目标没有这个性质。
反例告诉我们,箭头为什么不能倒过来
分布完全一样,两个变量也可以一直相反
令 X 以各一半概率取 −1 和 1,并令所有 Xn=−X。每个 X 与 的分布完全相同,自然有 。
但它们是在同一个结果上比较的。只要 X=1,Xn 就是 −1;只要 X=−1, 就是 。因此始终有
∣Xn−X∣=2,P(∣Xn−X
它们不依概率收敛到彼此。分布相同没有记录两个变量如何配对,这正是联合分布一章已经强调过的区别。
每次出错概率很小,同一个点仍然能反复出错
在 [0,1) 上按均匀概率取 U。把区间先切成两份,依次亮起每一份;再切成四份,依次亮起每一份;再切成八份,继续进行。每亮起一块,就定义一个随机变量:U 落在亮起区域时取 1,否则取 0。
准确地说,对 k=1,2,…、j=0,1,…,2k−1,令
X2k+j−1=1{j/2
每一轮第 k 层的亮区长度都是 2−k,所以该轮所有变量都满足
P(Xn=1)=E[Xn2]=2
当 n→∞ 时,对应层数 k→∞,因此 Xn→0 既是依概率收敛,也是均方收敛。
然而固定任意一个 u∈[0,1),每一轮总有恰好一块包含它,所以 Xn(u) 会无穷多次等于 1;每轮还有其他块不包含它,因此又无穷多次等于 0。这条路径根本不收敛。小概率的坏集合可以不断换位置,最终反复扫过每一个点。
这个例子同时说明:依概率不能一般推出几乎处处,均方也不能一般推出几乎处处。我们不需要让变量相互独立,就能看清这个逻辑差别。
几乎每条路径都归零,平均平方误差仍然不降
仍取 U 在 (0,1) 上均匀分布,令
Yn=n1
固定任意 u>0,只要 n>1/u,就有 u>1/n,所以 Y,以后一直为 。因而 几乎处处成立。
但每个 n 都留着一块长度 1/n 的区域,那里变量高达 n。平方后再平均:
E[Yn2]=n⋅n1=1.
所以它不均方收敛到 0。路径收敛允许越来越罕见但越来越大的尖峰;均方收敛会把尖峰的高度平方后一起计入。
如果再把高度换成 n,令 Zn=n1{U<1/n},仍有 几乎处处,但 始终不变。这也提醒我们:随机变量收敛,并不自动允许交换极限与期望;需要额外的可积控制。
弱大数定律:终于证明平均值会稳定
现在我们可以准确表达开头的目标。设 X1,X2,… 独立同分布,并且
E[X1]=μ,Var(X1)=σ
记总和与样本均值为
Sn=i=1∑nXi
有限方差版本的弱大数定律说:
XnPμ.
这里趋近的是平均值,不是每一个单次观测 Xn。例如掷骰子的平均点数可以接近 3.5,而任何一次骰子都不可能掷出 3.5。
先把中心找准
期望的线性性给出
E[Xn]=n1
这一步没有用独立性。它只说样本均值的期望在正确位置上,却还不能保证样本均值集中在那里。一个分布可以均值正确、散得很开,所以必须再控制波动。
再算波动为什么缩小
把和的方差完整展开:
Var(Sn)=i=1∑n
独立性使不同项之间的协方差为零,同分布使各个方差都等于 σ2,因此
Var(Xn)=n
平均值的均方误差正好等于这个方差:
E[(Xn−μ)2]=n
所以我们实际上已经证明了均方收敛。再使用 Chebyshev 不等式,对每个固定 ε>0,
P(∣Xn−μ∣≥ε)≤n
这就是完整证明。核心不是“数多了,所以平均起来一定好”,而是独立性消除了协方差项,除以 n 又使方差按 1/n 缩小。前面学过的期望、独立性、协方差和不等式,终于在这里合在了一起。
独立同分布是方便的条件,不是唯一可能
回看证明,消掉协方差只需要两两不相关,不一定需要完全独立。同分布也可以放宽:若各变量均值同为 μ、两两不相关且方差有限,那么
E[(Xn−μ)2]=
只要右边趋于零,同样有均方与依概率收敛。例如所有方差都不超过某个固定常数 C,右边就不超过 C/n。这个推广来自刚才的证明,没有更换推理结构。
反过来,若把同一个随机变量重复记成 X1=X2=⋯=Y,各项分布完全一致,但它们不是独立的新信息。此时 ,无论记录多少次,都不会把 的随机性平均掉。只要 非常数,样本均值就不会依概率趋于 。
概率与频率,在这里接上了
设每次独立试验中某事件发生的概率都是 p,用 Xi 表示第 i 次是否发生:发生记 1,否则记 0。于是
E[Xi]=p,Var(Xi)=p(1−
而 Xn 正是发生频率。因此
P(∣Xn−p∣≥ε)≤
最后一步用了 p(1−p)=1/4−(p−1/2)2≤1/4,即便不知道 p,也能给出一个统一控制。这条证明没有把频率稳定当作概率的定义,而是从独立试验模型和给定的 推出了频率稳定。
“次数足够多”可以落实成什么数字
如果想让频率偏离 p 至少 0.04 的概率不超过 0.05,一个充分条件是
4n(0.04)21≤0.05.
整理得到
n≥4⋅0.0016⋅0.051=3125.
所以 n=3125 是只依靠这些条件可用的充分样本量。它不是最小样本量,也不保证任何一串 3125 次的结果都达到误差要求。保证的是:在这个模型中,失败事件的概率至多为 5%。
更一般地,若单次变量的方差已知为 σ2,希望
P(∣Xn−μ∣≥ε)≤δ,
其中 0<δ<1,可以取
n≥δε2σ2,
并向上取整到正整数。例如均值为 5、方差为 9,要求误差达到 0.5 的概率至多 0.01,代入得到 n≥3600。把允许误差减半,这个充分样本量就会乘以 4;这已经预示了下一章会出现的 1/ 波动尺度。
同一个问题,可以同时看截面和路径
把 n 固定,观察许多轮各包含 n 次试验的实验,得到的是样本均值在这个时刻的分布。固定其中一轮,再按 1,2,3,… 的顺序不断增加观测,得到的则是一条样本均值路径。前者帮助理解依概率收敛,后者帮助理解几乎处处收敛。
用一个可以精确复算的例子,把上界与真实概率分开。设 Xi 独立同分布于参数 0.4 的 Bernoulli 分布,允许误差为 0.2。则 Sn∼,因此真实偏离概率等于
P(∣Xn−0.4∣
Chebyshev 上界则是 0.24/(0.04n)=6/n。对下面三个样本量,计算结果是:
上界始终有效,但这里真实概率比上界下降得快得多。这是因为二项分布还含有有界性、具体概率质量等信息,而 Chebyshev 只保留了方差。表格是这个具体模型在三个样本量下的计算,不能把表中的下降误读成所有模型的真实偏离概率都逐步单调下降。
如果自己编写模拟,要区分“每轮样本量”与“重复轮数”。增加样本量,改变被研究的样本均值分布;增加重复轮数,主要让模拟的偏离比例更准确地估计那个概率。有限模拟的比例可以偶然超过理论上界,也可以显示为零;理论上界约束的是模型的真实概率,而不是每一批有限模拟的频数。
还可以比较含少量极端值的模型:令单次变量以 99% 的概率在 [−1,1] 上均匀取值,以各 0.5% 的概率取 −24 或 24。它的均值为 0,方差为
0.99⋅31+0.01⋅242=6.09.
偶尔出现的大观测会使均值路径明显跳动,但有限方差弱大数定律仍然适用。这样的模型很适合提醒我们:长期趋近与短期看起来平稳,是两件不同的事。无论模拟多少条有限路径,都不能用“画出来都很稳定”替代关于无限序列的证明。
下面的交互同时展示样本均值路径和固定时刻的偏离比例。先选择 Bernoulli 分布,固定误差阈值,再增加每轮样本量;随后切换到含少量极端值的分布,观察偶发大数值怎样影响平均。交互统计的是严格超过误差阈值的事件,表格计算则包括边界;Bernoulli 这类离散模型中,两者可能有差别。
固定种子时,点“重新模拟”会重现相同参数下的结果;要查看另一批随机轨迹,应使用“换种子”。“重复次数”增加的是独立实验的模拟轮数,不能把它与每轮的样本量混为一谈。
强大数定律:把整条无限路径纳入结论
弱大数定律控制每一个越来越靠后的观察时刻。我们还可以问:如果沿着同一串结果一直观察,平均值是否最终真的收敛?
独立同分布的强大数定律给出准确答案:若 X1,X2,… 独立同分布,且
E[∣X1∣]<∞,
记 μ=E[X1],则
P(n→∞limXn=μ)=
注意它只要求绝对可积,没有要求有限方差。前面有限方差的弱定律是一条容易完整证明、还带有限样本误差上界的结论;这里的强定律既使用了更强的收敛方式,也允许更宽的矩条件。不能因为分别叫“弱”和“强”,就把它们的假设强弱也照着名字排列。
一般可积版本的证明需要截断来处理重尾,并控制整个后续序列。为了在本章真正看见强收敛如何被证明,我们下面增加有限四阶矩这一条件,给出一个从现有工具就能走完的证明。它证明的是强定律的一个充分条件版本,不冒充已经证明了全部可积情形。
为什么弱定律的上界还不够直接用
如果记 An={∣Xn−μ∣>ε},弱定律给出 。这足以说明单次概率趋于零,却不能靠直接求和控制无穷次偏离,因为 发散。
我们想要的是一个可求和的上界。假如能得到 P(An)≤C/n2,那就可以说明偏离事件几乎必然只发生有限次。先把这个关键事实证明出来。
可求和的坏事件,几乎必然只发生有限次
设一列事件 A1,A2,… 满足
n=1∑∞P(An)<∞.
对任意 m,从第 m 步以后至少发生一次坏事件的概率由并集上界控制:
P(n≥m⋃An)≤
右边是收敛级数的尾和,随 m→∞ 趋于零。“发生无穷多次”意味着无论从哪一步开始,后面至少还发生一次,因此
P(An 发生无穷多次)=0.
这就是 Borel–Cantelli 第一引理。证明只用了并集上界和概率连续性,不要求这些事件独立。这一点稍后很实用:不同 n 的样本均值共用了前面的观测,相应偏离事件通常并不独立。
有限四阶矩怎样给出可求和的概率
现在额外假设 E[∣X1∣4]<∞。令
Yi=Xi−μ,Tn
并记
E[Yi]=0,E[Yi2]
中心化以后四阶矩仍有限,例如 ∣x−y∣4≤8(∣x∣4+∣y∣4) 足以保证这一点。我们要计算 。把四次方展开,每一项都是四个 的乘积。
只要某个下标只出现一次,独立性就会让该项期望含有因子 E[Yi]=0,整项消失。留下来的只有两类:四个下标全相同,以及两个下标各出现两次。
全相同的项共有 n 个,每项期望 m4。两两配对的项先选不同下标,共有 (2n) 种;固定这两个下标后,在四个位置里安排各两个,共有 6 种,每项期望为 。因此
E[Tn4]=nm4+6
由于 Xn−μ=Tn/n,对误差的四次方使用 Markov 不等式:
P(∣Xn−μ∣>ε)≤
最后一步用了 n≥1。右侧关于 n 的级数收敛,Borel–Cantelli 第一引理便说明:对这个固定 ε,偏差超过 ε 的情况几乎必然只出现有限次。
还差一步,不能直接把不可数多个“概率为一”的事件随意相交。我们先只取可数阈值 ε=1,1/2,1/3,…。每个阈值都给出一个概率为一的事件,它们的可数交仍然概率为一。在这个交集上,给定任意正误差 η,选一个 k 使 1/k<η,之后的误差最终都小于等于 ,当然也小于 。
所以在这个概率为一的集合上,Xn→μ。有限四阶矩版本的强大数定律证明完成。
长期稳定没有替短期结果作承诺
频率会收敛,下一次却不会补偿过去
假设独立公平硬币前 20 次正面比反面多。下一次正面的条件概率仍是 1/2,不会为了把账抹平就改成更小的概率。大数定律不需要这种补偿机制。
看一个确定的前缀就够了。假设前 r 次记录已固定,把 n 次平均拆成
Xn=nX
固定前缀的总和除以不断增大的 n 会趋于零,后半段的平均则遵守同样的大数规律。早期的偏差可以被越来越大的分母稀释,不必靠后面故意产生反向偏差来纠正。
收敛不要求误差一步比一步小
样本均值满足递推关系
Xn+1−μ=n
第一项把过去的偏差缩小一点,第二项加入新的随机偏差。如果新观测恰好朝同一方向偏得较远,总误差就会比上一步更大。因此,路径误差没有单调性保证,固定阈值下的真实偏离概率也不必随每个整数 n 单调下降。趋于零与单调下降是两回事。
方差无限时,先检查期望,而不是直接判失败
考虑定义在 x≥1 上的密度
f(x)=23x−5/2,
区间外密度为零。积分可验证它总面积为 1,而且
E[X]=23∫1∞x
但
E[X2]=23∫1
这个变量非负、可积,方差却无限。独立同分布样本的均值仍由一般强大数定律保证几乎处处趋向 3;只是有限方差的 Chebyshev 证明及其 σ2/(nε2) 上界不能使用。刚才给出的有限四阶矩证明也不适用。
若连有限期望都没有,情况可以彻底不同。例如独立标准 Cauchy 变量的样本均值仍服从标准 Cauchy 分布,分布不会随着 n 增大而集中。用上一章的特征函数可以直接检查:单个变量的特征函数为 e−∣t∣,所以
φXn(t)
因此对每个 n,都有 P(∣Xn∣>1)=1/2。对称中心为 0 并不意味着期望为 ;Cauchy 的正负部分期望都发散,普通期望不存在。不能先给它安上一个不存在的均值,再要求平均值趋向那里。
把几条判断亲手连起来
只知道平均费用,能确定尾概率吗
设 L≥0 且 E[L]=120。求 P(L≥600) 的通用上界,并构造一个取到该上界的分布。再构造一个符合条件但尾概率为零的分布。
Markov 不等式给出
P(L≥600)≤600120=0.2.让 L 以 0.2 的概率取 、以 的概率取 ,便取到上界。让 恒等于 ,尾概率就是零。二者均值相同,这说明均值能限制尾概率,却不能唯一确定它。
同一个误差要求,方差怎样影响次数
某次独立测量的均值为 8、方差为 4,用 n 次独立同分布测量的平均作为结果。找一个充分的 n,使平均值偏离 8 至少 0.2 的概率不超过 0.05。若把允许误差改为 0.1,这个充分样本量怎样变化?
样本均值的方差为 4/n,所以
P(∣Xn−8∣≥0.2)
看到四次方,Jensen 的条件要怎么查
设 E[∣X∣]<∞。判断 (E[X])4≤E[X4] 是否成立。如果 ,该如何理解?
函数 g(x)=x4 在整个实数轴上凸。若四阶矩有限,Jensen 直接给出
(E[X])4≤E[X
尖峰变高以后,哪些收敛还在
令 U 在 (0,1) 上均匀分布,Xn=n1{U<。判断它是否几乎处处、依概率、均方和依分布收敛到 ,并检查期望是否趋于 。
固定 u>0,足够大的 n 都满足 u>1/n,于是 Xn(u)=,所以几乎处处收敛成立。它因此也依概率和依分布收敛到 ;直接计算也有,对于固定 和足够大的 ,
同分布能替代独立吗
令 Y 为参数 1/2 的 Bernoulli 变量,定义 Xi=Y。这些变量是否同分布?它们的平均是否依概率收敛到 1/2?这与大数定律冲突吗?
它们的确同分布,但所有变量都是同一个 Y,并不独立。平均值始终等于 Y,所以
P(X
从可求和误差走到路径收敛
设一列随机变量满足:对每个 ε>0,存在有限常数 Cε,使所有 n 都有
P(∣Zn∣>ε)≤n2C
不假设 Zn 彼此独立,证明 Zn→0 几乎处处成立。
先固定正整数 k,取 ε=1/k。因为
n=1∑
平均值稳定以后,还剩下什么问题
最初那句“次数很多时,频率接近概率”,现在已经有了两种严格读法。弱定律给出每个固定误差阈值下的偏离概率趋于零;强定律给出几乎每条无限路径的平均都趋向期望。它们依靠明确的独立性和可积条件,不需要短期补偿,也不要求误差一步比一步小。
但我们还没有回答另一个实际问题:n 很大而且有限时,样本均值究竟在 μ 周围怎样波动?有限方差时,我们已知它的标准差是 σ/n。如果直接看 ,分布会越来越集中在 ;如果把这层不断缩小的波动放大,考察
σ/nX
其中 0<σ2<∞,会不会看到一个稳定的分布形状?下一章的中心极限定理正是要回答这件事:大数定律先确定平均值趋向哪里,再在合适条件下研究放大后的误差长什么样。