生成函数、矩母函数与随机变量和
上一章算两个随机变量的和时,我们做了一件很具体的事:把所有可能凑出同一个总数的组合找出来,再把它们的概率加起来。离散情形叫卷积求和,连续情形叫卷积积分。这个办法很踏实,可一旦从两个变量变成十个、几十个,计算就不太友好了。
先别急着增加计算量。我们可以换一种记录分布的方式。假设一个小订单包含的商品件数 X 只可能是 0,1,2,概率分别是 0.2,0.5,0.3。把这三个概率写成
0.2+0.5s+0.3s2,
你会发现,概率一个也没少,只是各自挂上了一个标记:s 的指数告诉我们商品有几件,系数告诉我们这种件数有多大概率。如果把两个独立订单对应的多项式相乘,展开式恰好会自动完成“件数相加、概率相乘、相同总数再合并”的工作。
这就是本章的出发点:既然每次卷积都在重复同一种运算,能不能让函数替我们把这些账记好?我们先从计数变量的概率生成函数走起,再把这个想法推广到一般实值随机变量,最后看看它为什么能为中心极限定理铺路。
把概率写成系数,卷积就有了另一种样子
继续看上面的订单。令 Y 是另一个与 X 独立、分布相同的订单件数。两份订单一共有 S=X+Y 件商品。若直接算 P(S=2),我们会写
P(S=2)=P(X=0,Y=2)+P(X=
独立性让每一项都能拆成两个概率的乘积,所以答案是
P(S=2)=0.2×0.3+0.5×0.5+0.3×0.2=0.37.
现在把多项式相乘:
(0.2+0.5s+0.3s2)2=0.04+0.20s+
看 s2 的系数,刚好就是 0.37。原因没有藏在什么新定理里:第一份订单的 sj 和第二份订单的 sk 相乘,会变成 ;指数相加,对应商品件数相加。系数相乘,对应独立事件的联合概率。最后合并同类项,对应把不同组合的概率加起来。
于是,一个多项式就把 S=0,1,2,3,4 的概率全部算了出来。我们并没有绕过卷积,而是把卷积装进了熟悉的多项式乘法。
这个例子也能帮我们区分“保留整个分布”和“只保留几个摘要”。如果只告诉你订单平均有 1.1 件,你不能据此恢复每种件数的概率;即使再告诉你方差,一般也还不够。可只要这个多项式完整地交给你,所有概率都在它的系数里。
下面只盯住乘积中的二次项。总件数等于二的三种组合,正好对应多项式乘法里凑出 s2 的三条路线;独立性使每条路线的概率可以相乘,互斥性使三条路线的贡献可以相加。
独立订单的总件数为二时,三种组合贡献0.06、0.25和0.06;它们的和0.37正是总和概率母函数中s²的系数。
概率生成函数:先读零点,再走向一
为什么定义在非负整数上
设 X 只取非负整数,记 pk=P(X=k)。它的概率生成函数,简称 PGF,定义为
GX(s)=E[sX]=k=0
在 s=0 时约定 00=1,这样 X=0 的那一项就是 p。这里的 是我们选来记录信息的参数,不是新的随机变量;真正需要按概率取平均的仍然是 。
为什么强调非负整数?因为每一个取值都要对应普通幂级数中的一个幂次。若 X 可能取 −1,就会出现 s−1,零点不再是合适的读数位置;若 X 连续取值,也不存在一串 p 可以如此编码。整数格点上的其他生成方法当然可以研究,但本章的 PGF 固定使用非负整数这个约定。
对于 ∣s∣≤1,有
k=0∑∞∣pksk∣≤
所以 PGF 至少在这个范围内绝对收敛。尤其是
GX(0)=P(X=0),GX(1)=
第二个等式只是全部概率之和等于 1,并没有要求均值或方差有限。如果图上某条“PGF 曲线”在 s=1 处不是 1,我们首先就该检查概率有没有归一化,或者数值计算有没有漏掉尾部。
在零点求导,读出某一个概率
在 ∣s∣<1 内,幂级数可以逐项求导。对 GX 求 k 阶导数,再代入 s=0,低次项已经被求导消掉,高次项仍然带着正次幂,只有原来的 留下 。因此
P(X=k)=k!GX(k)(
我们也把这个操作记为 [sk]GX(s),读作“取 sk 的系数”。它表达的是一种数学操作,不是要求每道题真的连续求导 k 次。前面的订单问题直接展开多项式,远比求二阶导数更清楚。
这也说明 PGF 为什么能确定整个分布:如果两个非负整数型变量的 PGF 在零点附近相同,各阶导数就相同,每个整数点上的概率也就相同。这里得到的是分布相同,不能进一步说两个随机变量在每次实验中都取同一个值,更不能推断它们和其他变量的依赖关系相同。
在一附近求导,为什么读出来的是平均值
对 0<s<1,
GX′(s)=k=1∑∞k
让 s 从左侧逐渐接近 1,每一项都逐渐接近 kpk,并且非负地增加。由非负项的单调极限,可以得到
GX′(1−):=s↑1lim
这条等式允许两边都是 +∞。如果我们想把 GX′(1−) 当作一个有限的斜率使用,就必须有 E[X]<∞。同样地,
GX′′(1−)=E[X(X−1)].
更一般地,r 阶导数读出的是下降阶乘矩:
GX(r)(1−)=E[X(X−1)⋯(X−
为什么多了这些减一、减二?因为 sk 每求一次导数,幂次就少一,下一次乘下来的系数自然变成 k−1。这是求导的结果,不能直接把 GX′′(1−) 写成 。
只要二阶矩有限,利用 X2=X(X−1)+X,便有
E[X2]=GX′′(1−)+G
Var(X)=GX′′(1−)+G
订单例子中,GX′(s)=0.5+0.6s,GX,所以
E[X]=1.1,E[X2]=1.7,Var(X)=1.7−
PGF 在 s=1 处取值为 1,并不保证它在 1 的右侧还能定义成有限函数,也不保证左侧导数有限。因此一般情形写 GX 更准确。有足够的收敛范围时,才可以把它简写成通常的 。
一个能把这件事看清楚的例子是
P(X=k)=k(k+1)1,k=1
由于 1/[k(k+1)]=1/k−1/(k+1),这些概率相加恰好为 1,所以确实定义了一个分布。可是
E[X]=k=1∑∞k+11
它的 PGF 在 s=1 仍然等于 1,从左侧接近这个点时斜率却趋于无穷。对于任何 s>1,级数的项甚至不趋于零,PGF 就发散了。有限函数值、有限导数、能在右侧延伸,是三件不同的事。
独立和变成乘法,独立性到底用在哪里
对独立的非负整数型随机变量 X,Y,在 0≤s≤1 内有
GX+
第二行只是指数运算法则;第三行才用了独立性。我们之前学过,独立变量分别经过确定的函数变换后仍然独立,因而可以把两个有界变量 sX,sY 的乘积期望拆开。
从系数看,这条等式对应
GX(s)GY(s)=
括号里就是上一章的离散卷积。函数乘法和卷积不是互不相干的两种技巧,它们是在不同记法下做同一件事。
若 X1,…,Xn 相互独立,则
GX1+⋯+Xn(s)=
如果还同分布,右边才进一步变成 GX(s)n。同分布负责“每一个因子相同”,独立负责“能把因子乘起来”。这两个条件各管一件事。
同分布的两个变量,和的分布可以完全不同
让 X 以各一半的概率取 0,1。如果 Y 是独立的一份,那么
GX+Y(s)=(21+s
如果改成 Y=X,两者的边缘分布没有改变,但和只会是 0 或 2:
GX+Y(s)=G2X(s)=
若改成 Y=1−X,边缘分布仍然一样,总和却恒等于 1,PGF 就是 s。你看,只知道两个变量各自的 PGF,完全不够决定它们的和;还需要知道它们如何一起出现。独立性正是让边缘信息足以算和的一项额外结构。
骰子和的系数怎样读
公平六面骰子的点数 D 有
GD(s)=6s+s2+
独立掷三次,总点数 T 的 PGF 是这个函数的三次方。若只关心 P(T=5),不必把从 s3 到 s18 的项全部展开。三个正整数相加等于 ,可能的类型只有 和 ;每种类型各有三个排列,因此
P(T=5)=[s5]GD(s)3
当骰子不公平时,仍然找同样的项,只是每个项的系数要按实际点数概率相乘。生成函数把计数和概率自然接在了一起。
矩母函数:用指数权重记录一般分布
PGF 很适合“几件、几次、几个”,可等待时间、温度误差这些变量并不只取非负整数。我们需要一种不依赖整数幂次的写法。
注意 PGF 里的 sX。如果令 s=et,它就变成 etX。指数表达式对任何实数 X 都有意义,于是定义,简称 MGF:
MX(t)=E[etX].
离散变量可以求和,有密度的变量可以积分:
MX(t)=x∑etxP(X=
MX(t)=∫−∞∞e
一般分布直接使用期望定义,不必先判断它有没有密度。对非负整数型变量,在两边有限的参数范围内确实有 MX(t)=GX(et)。但请留意:t 对应 ,恰好走到了 PGF 不保证收敛的区域。
“存在”不能只看零点
每个实值随机变量都满足 MX(0)=1。如果只检查这一点,所有变量都过关,却不能说明任何关于尾部的事情。本章说“MGF 在零点附近存在”,特指存在 a>0,使得
MX(t)<∞,−a<t<a.
这为什么是个实质性条件?当 t>0 时,大的正值会被 etX 加上很高的权重;当 t<0 时,很小的负值会被放大。要求两侧都能承受一点指数放大,便同时约束了左右两侧的尾部。
例如等待时间 X∼Exp(λ),其中 λ>0 是率参数。直接按定义算:
MX(t)=∫0∞e
当 t<λ 时,指数衰减,得到
MX(t)=λ−tλ.
当 t=λ 时,被积函数恒等于 λ;当 t>λ 时,它还会随 x 增长。这两种情况积分都为 +∞。
所以 λ/(λ−t) 必须和条件 t<λ 一起使用。把 t>λ 代进去虽然能算出一个负数,但那个负数绝不可能是 E[e,因为被平均的量处处为正。代数表达式有值,不等于原来的概率积分存在。
这里还有个细微区别:MGF 的积分在所有 t<λ 都有限,而它在零点的幂级数展开只有 ∣t∣<λ 才收敛。函数本身的定义域不一定等于某个中心的泰勒级数收敛范围。
为什么导数会读出普通矩
指数函数有一个方便的性质:对 t 求导,每次都会带出一个 X:
dtrdretX=X
只要 MGF 在零点的某个开邻域内有限,就能在稍小的邻域里合法地交换求导与期望,得到
MX(r)(t)=E[Xr
这里的交换不是凭形式硬做。选取邻域内的一个 b>0,有
E[eb∣X∣]≤MX(b)+M
任意固定次数的 ∣X∣r 都能被一个略快的指数函数控制,因此 XretX 在更小的 t 区间里有可积的共同上界。正是这层控制,让求导和取平均可以交换,也保证所有绝对矩 有限。
由此可以读出
E[X]=MX′(0),E[X2]
Var(X)=MX′′(0)−(M
和 PGF 对照一下:PGF 在 1 的左侧读阶乘矩,MGF 在 0 读普通矩。位置和读出来的对象都不同。
这些导数还有一个检查图像的用途。在 MGF 有限区间内部,MX′′(t)=E[X2etX]≥,所以 MGF 必须是凸函数。若示意图画成先明显向下弯、再向上弯的 S 形,就不符合这个基本性质。MGF 不一定递增,例如均值为负时零点斜率就是负的;“斜率可能为负”和“斜率随着 增大不能下降”并不矛盾。
对指数分布,
MX′(t)=(λ−t)
因此 E[X]=1/λ,E[X2]=2/λ2,方差为 。我们以前通过积分算出的结论,现在从同一个函数的两个导数里又得到了。
从函数识别分布,还需要哪些依据
MGF 的唯一性说的是什么
假设 X,Y 的 MGF 在同一个零点开邻域内有限,并且在这个邻域里相等,那么 X,Y 的分布相同。这是 MGF 的唯一性定理。
它让一种常见解题步骤有了依据:先算出目标变量的 MGF,再认出这是某个已知分布的 MGF,最后断定分布相同。最后一步并不是“看起来相像”,而是在使用唯一性。完整的一段论证应该交代存在区间确实包含零点邻域。
有限取值的情形可以看得更直接。例如
MX(t)=0.3+0.4et+0.3e3t
恰好记录了取值 0,1,3 及其概率。一般分布的唯一性证明需要更深入的分析工具,本章把它作为可用定理;后面的特征函数会提供适用范围更广的唯一性结论。
这里不要把两个说法混在一起:“两个 MGF 在零点邻域相同”和“所有阶矩相同”。前者有明确的存在性条件,能推出同分布;后者若不加条件,在无界分布中不一定成立。即使每一个矩单独存在,把它们拼成一条无穷泰勒级数时,也仍然可能没有任何非零的收敛区间。
平移、伸缩与独立和
令 Y=aX+b,其中 a,b 是常数。按定义整理便有
MY(t)=E[et(aX+b)]=e
右边要求 at 落在 MX 的有限范围内。特别是标准化变量 Z=(X−μ)/σ,,满足
MZ(t)=e−μt/σMX(t/
若 X,Y 独立,且两个 MGF 在考察的参数处有限,则
MX+Y(t)=E[etXe
若 Y=X,这里就应改成 M2X(t)=MX(2t),通常不等于 。这和 PGF 的独立性问题完全相同,换一套符号并不会让条件消失。
对数矩母函数把乘法再变成加法
在 MGF 有限的零点邻域里,MX(t)>0,可以定义
KX(t)=logMX(t).
求导得到
KX′(t)
利用 MX(0)=1,便有
KX′(0)=E[X],KX
因此在零点附近,
KX(t)=μt+2σ2
如果 S=X1+⋯+Xn 且各项相互独立,那么
KS(t)=j=1∑nK
对等式求一阶、二阶导数,就又得到独立和的均值、方差可加。这里还需要回顾此前学过的区别:期望可加本来就不要求独立;方差可加一般需要各项不相关,独立是足够条件。对数 MGF 给出了在它适用时的一条统一推导,并没有把期望线性性的范围缩小。
常见分布的函数,怎样算出来而不是背下来
伯努利、二项与泊松
一次成功记 1、失败记 0,成功概率为 p,那么
GX(s)=1−p+ps,MX
n 次独立且成功概率相同的试验,成功总次数的 PGF 就是
GS(s)=(1−p+ps)n.
按二项式展开,sk 的系数为 (kn)pk(1−,于是重新得到二项分布。我们这次是从独立和与函数乘法走到二项概率,而不是先数排列再写概率。
如果各次成功概率是 p1,…,pn,函数变成
GS(s)=j=1∏n(1−p
一般不能把它写成某个 (1−p+ps)n。不同成功概率的伯努利和,不会因为同样是在“数成功次数”,就自动成为普通二项分布。
对 X∼Poisson(λ),直接求和:
GX(s)
因此 MX(t)=exp{λ(et−1)},对所有实数 t 都有限。若 独立,分别服从参数为 的泊松分布,那么
GX+Y(s)=eλ
由 PGF 唯一性,X+Y∼Poisson(λ1+λ2)。这个结论针对同一观察区间内的两个独立计数。若要进一步说“两条到达过程合并后是泊松过程”,还要对各个时间区间的增量结构作假设,单独一个计数分布并不能说明整条过程。
几何与负二项:先说清楚数的是什么
本课程主要把几何变量 T 定义为首次成功所需的总试验次数,所以 T=1,2,…。令 q=1−p,先取 0<,则
P(T=k)=qk−1p,
GT(s)=k=1∑∞
MT(t)=1−qetpe
分子里的 s 或 et 正是在提醒我们:至少要试一次。若改数成功之前的失败次数 F=T−1,才得到
GF(s)=1−qsp,M
因此,看到几何分布的函数少了一个 s,先检查它数的是失败次数还是总次数,不要立刻判断公式写错。
若连续做独立伯努利试验,直到第 r 次成功为止,总试验次数 Tr 可以分成 r 段独立的几何等待时间,于是
GTr(s)=(
这里 r 为正整数,Tr=r,r+1,…。若数失败总次数 F,函数的分子就分别变成 。两种都是常见的负二项参数约定;变量取值范围必须跟公式一起交代。当 时,、 都是常数,直接用 、,无需再写含 的边界。
指数、Gamma 与“同一个率”
设 X∼Gamma(α,λ),这里 α>0 是形状参数,λ>0 是率参数,密度为
fX(x)=Γ(α)λα
乘上 etx 后,指数部分从 e−λx 变成 e−(λ−t)x。当 时,利用 Gamma 积分的归一化形式,得到
M
当 t≥λ 时积分发散。若使用尺度参数 θ=1/λ,同一个公式写成 (1−θt)−α,有限范围是 。这是参数换写,不能同时把同一个符号当成率和尺度。
设 X,Y 独立,形状分别为 α1,α2,共同率为 λ,那么
MX+Y(t)=(λ−tλ
右边是 Gamma(α1+α2,λ) 的 MGF,并在零点邻域有限,由唯一性得到同率 Gamma 的可加性。形状相加,率不变。
同率条件不能省略。比如两个独立指数变量的率分别是 2 和 5,其和的 MGF 是
2−t25−t5,t<2.
这里有两个不同的分母因子,通常无法合并成单一率 Gamma 的形式。它仍是一个合法的等待时间总和,只是不能直接认成我们熟悉的同率 Gamma。
正态分布与线性组合
先看 Z∼N(0,1)。配方得到
M
最后的积分等于 1,因为它是均值为 t、方差为 1 的正态密度的全积分。若 X=μ+σZ,σ>0,便有
MX(t)=eμt+σ2t
设相互独立的 Xj∼N(μj,σj2),对常数 ,
L=b+j=1∑najX
的 MGF 为
ML(t)=exp{(b+
只要结果方差为正,这就识别出一个正态分布;方差为零时 L 是常数。均值里的系数是 aj,方差里的系数是 aj2,这一点和此前方差的缩放规则一致。
这是独立正态变量的精确闭合性:两个、三个变量就已经成立。后面的中心极限定理讨论一般分布的标准化和在项数增加时的极限,性质不同。不要把“正态变量相加仍正态”和“一般变量相加可能近似正态”混成同一句话。
经过上面的推导,下面这张表可以用来核对结果。它省掉的是重复计算,不省略参数约定。几何变量数首次成功的总次数,负二项变量数第 r 次成功的总次数;这两行取 0<p<1,并记 q=1−p。
表里的 PGF 至少都可以在 0≤s≤1 使用。要向这个区间之外延伸,仍应检查各自的级数;尤其几何、负二项需要 ∣qs∣<1。连续分布栏的“不使用 PGF”指本章按非负整数系数定义的概率生成函数,不是说连续分布不能用任何函数记录。
随机个数的和,为什么出现函数复合
之前加几项由我们预先确定。现在换一个订单问题:一天有 N 个订单,每个订单的件数为 X1,X2,…,当天总件数为
S=j=1∑NXj.
约定 N=0 时 S=0。假设 N 是非负整数型变量,Xj 独立同分布、取非负整数值,而且整个序列 与 独立。这个假设表达的是:订单数量不改变单个订单件数的概率规律。
先把 N 固定成 n。条件在 N=n 上,总件数就是 n 个独立同分布变量之和,因此对于 0≤s≤1,
E[sS∣N=n]=GX(s)n.
再对 N 取平均:
GS(s)
这里出现复合函数,是因为我们先用 GX(s) 表示“一份订单贡献的函数因子”,再让外层 GN 决定这样的因子重复多少次。内外层顺序不能颠倒。先数订单,再累加订单里的商品,和先数商品再让它们生成订单,是不同模型。
若 N∼Poisson(λ),便得到复合泊松的 PGF:
GS(s)=exp{λ(GX(s)−1)}.
回到每份订单 0,1,2 件、概率 0.2,0.5,0.3 的例子,若每天订单数服从 Poisson(4),那么
GS(s)=exp{4(0.2+0.5s+0.3s2−1
当天总件数为零,不一定意味着没有订单,也可能收到的订单都贡献了零件。直接代入 s=0 得
P(S=0)=e4(0.2−1)=e−3.2.
这比单纯的“零订单概率”e−4 大,符合模型的含义。
随机和的均值与方差
若 N,X1 有限二阶矩,记 μ=E[X1]、。对复合 PGF 使用链式法则,取 ,得到
GS′(1−)=GN′(1
GS′′(1−)=E[N(N−1)]μ
将第二式加上 E[S] 再减去 E[S]2,整理为
Var(S)=E[N]σ2+Var(N)μ2.
这个式子最好和条件方差一起理解。给定 N 时,订单件数自身的波动产生 Nσ2;不同日子的订单数量又让条件均值 Nμ 随机变化。对前者取平均、对后者取方差,正好得到这两项。
在 N∼Poisson(λ) 时,E[N]=Var(N)=λ,所以
E[S]=λE[X1],Var(S)=λE[X
订单例子的均值为 4×1.1=4.4,方差为 4×1.7=6.8。若只写成 4×0.49,就漏掉了订单数量本身的波动。
对一般实值的单项 Xj,只要有关期望有限,也可以写
MS(t)=E[MX(t)N].
但外层期望还要重新检查。MX(t)>1 时,相当于把 N 的 PGF 放到 1 的右侧;单项 MGF 存在,并不自动保证随机和的 MGF 存在。固定项数和随机项数在这里有一个真实的差别。
重尾会让 MGF 失效,却不会让分布消失
“所有熟悉的例子都有 MGF”,容易让人误以为不存在只是一种很偏僻的例外。事实上,指数加权对尾部的要求相当高,连均值方差都有限的变量也可能通不过。
设非负变量 X 的密度为
fX(x)=x43,x≥
其他位置密度为零。它确实归一化,并且
E[X]=3∫1∞x−3dx=
E[X2]=3∫1∞x
然而对任意 t>0,
MX(t)=3∫1∞
指数增长终究快过四次幂,所以尾部无法被积分控制。对于 t≤0,由于 X≥1,etX≤1,MGF 的期望反而有限。它拥有整个左半轴的有限值,却没有零点的双侧开邻域。有限均值、有限方差,都不足以保证本章的 MGF 方法可用。
还有更强的例子。设 Z∼N(0,1),令 L=eZ。它的每一个正整数阶矩都有限:
E[Lr]=E[erZ]=er
但是当 t>0 时,
ML(t)=2π
因为当 z 足够大,tez 会压过 z2/2,被积函数甚至不趋于零。这个例子直接说明:所有阶矩有限,仍不代表 MGF 在零点附近存在。 前面交换求和、求导与期望的条件,不能因为指数函数有泰勒展开就跳过去。
MGF 失效说明指数权重不适合这个分布的尾部,并不说明变量没有分布,也不说明它没有均值、方差或任何极限性质。刚才密度为 3/x4 的例子具有有限正方差,仍满足独立同分布中心极限定理对单项分布的矩条件。要覆盖它,我们需要不依赖 MGF 存在的工具。
特征函数:把指数放大换成有界的转动
有没有一种权重,既保留“相加变相乘”的性质,又不会把大数值无限放大?复指数正好具备这两个特点。
定义随机变量 X 的特征函数为
φX(t)=E[eitX],t∈R,
其中 i2=−1。借助 eiu=cosu+isinu,这个定义可以拆成两个普通期望:
φX(t)=E[cos(tX)]+iE[sin(tX)].
你可以把每个可能的 X 值变成单位圆上的一支箭头,转过的角度为 tX,然后按概率对箭头取平均。X 再大,箭头也只是多绕几圈,长度始终是 1。因此
∣eitX∣=1,∣φX(t)∣≤E[
这保证每个实值随机变量的特征函数都对所有实数 t 存在,无需任何有限矩假设。它通常是复数,不是概率密度,也不需要处处非负。
保留了什么运算规则
因为 eit(X+Y)=eitXeitY,若 独立,仍然有
φX+Y(t)=φX(t)φY
平移伸缩的规则是
φaX+b(t)=eitbφX(at
还可以直接看出
φX(0)=1,φX(−t)=
如果 X 以相同概率取 −1 和 1,那么
φX(t)=2eit+e
它在某些 t 上取负值,完全没有问题。那只是平均箭头指向了复平面的左侧,不是出现了负概率。
总是存在,不等于总能任意求导
若 E[∣X∣r]<∞,可以交换求导与期望,从而得到
φX(r)(t)=E[(iX)
例如在二阶矩有限时,
φX′(0)=iE[X],φX
特征函数本身存在,只用了 ∣eitX∣=1;求导后多出了 X 或 X2,就需要相应的可积性。这和“一个函数有值不代表它必然可导”是同一个基本区别。
当 E[X2]<∞ 时,零点附近有二阶展开
φX(t)=1+itE[X]−2
这个结论只需要二阶矩,不要求三阶矩有限。粗略地把泰勒余项写成 O(∣tX∣3) 再取期望,会平白增加一个三阶矩条件;正确的余项控制还会用到复指数的有界性。这一细节决定了后面定理能够覆盖多广的分布。
为什么一条有界曲线还能记录整个分布
特征函数也有唯一性定理:若对所有实数 t,φX(t)=φY(t),则 X, 同分布。这里不需要 MGF 的零点邻域假设,也不需要密度存在。
若只看某个固定的 t,不同分布当然可能给出同样的平均箭头;唯一性使用的是全部实数 t 上的信息。可以把改变 t 理解为用不同的转动速度检查同一个分布,所有检查结果放在一起,才足以恢复它。
对于非负整数型变量,这种恢复甚至有一条直接公式:
P(X=k)=2π1∫−
代入 φX(t)=∑jP(X=j)e 后,每一项要积分的是 。当 时积分为 ,其他整数频率在完整周期内相互抵消,积分为零,因而只留下 。一般实值分布的恢复公式更复杂,本章暂不展开;这个离散算例已经说明,振荡没有把信息弄丢,只是换了记录方式。
从标准化和,看见中心极限定理的入口
到这里,我们一直在算有限个变量的和。接下来想问的是:项数 n 越来越大,和的分布会往哪里走?
设 X1,X2,… 独立同分布,均值为 μ,方差为 σ2,并且
0<σ2<∞.
先把单项标准化为 Yj=(Xj−μ)/σ,那么 E[Y、。由刚才的二阶展开,
φY(u)=1−2u2
再令
Zn=σn
独立性和缩放规则给出
φZn(t)=[φY
对每个固定实数 t,t/n 会走向零,于是刚好可以利用单项特征函数在零点附近的展开:
φZn(t)=[1−
右边是标准正态分布的特征函数。这个负号来自 i2=−1;它和标准正态 MGF 的 et2/2 要分开记。
不过,到这一步还不能仅凭“函数收敛”四个字,就宣告一切完成。我们还需要一条连接函数和分布的定理:若一列特征函数在每个实数点收敛,且极限函数在零点连续,那么它对应某个概率分布,原来的一列分布也收敛到这个分布。这是特征函数的连续性定理。
在当前例子中,极限函数 e−t2/2 连续,又是标准正态特征函数,因而得到 Zn 依分布收敛到 N(0,1)。这就是独立同分布中心极限定理的证明主线。我们稍后会认真解释“依分布收敛”到底允许怎样计算概率,以及它和大数定律的“均值趋近”有何区别。
这里的结论建立在独立同分布、有限且正的方差、正确的中心化与缩放之上。它没有说任意分布的变量随便加起来都会变成正态,也没有说有限的 n 就精确正态,更没有保证所有密度曲线逐点收敛。特征函数帮我们证明的是在这些条件下的分布极限。
回头看我们为什么要走这么远:卷积让两个变量的和可以计算,生成函数让很多个独立变量的和可以简化,特征函数又让简化后的表达式适合研究极限。课程最开始凭直觉相信的“许多次试验会表现出稳定规律”,现在已经有了逐步证明所需的工具。
把条件带进计算的练习
从 PGF 读概率、矩和独立和
设 GX(s)=0.1+0.6s+0.3s2。求 P(X、、。若 是与 独立同分布的一份,求 。
s2 的系数直接给出 P(X=2)=0.3。求导得
G
用二项 PGF 重新得到均值与方差
设 X∼Binomial(n,p),n≥2,从 GX(s 推导均值与方差,并说明二阶导数为什么还不是二阶矩。
逐次求导:
GX′(s)=np(1−p+ps)n
几何变量少掉的那一次在哪里
某系统每次尝试独立地以概率 p=1/4 成功。令 T 为首次成功所需的总次数,F 为首次成功前的失败次数。写出两个 PGF,并求 E[T]、E[F]。
这里 T=F+1,所以
GT(s)=
识别独立和时把存在区间写完整
设 X∼Gamma(3,2),Y∼Gamma(1/2,2),两者独立,第二个参数是率。求 X+Y 的分布与均值。
两个 MGF 在 t<2 有限,因此共同有限区间包含零点的开邻域。独立性给出
MX+Y(t)=
复合泊松的方差为什么不等于均值
设 N∼Poisson(3),每个独立批次包含 1 件或 3 件商品,各有一半概率,批次大小序列与 N 独立。求总件数 S 的 PGF、E[S 和 。它是否服从普通泊松分布?
单批件数的 PGF 为 GX(s)=(s+s3)/2,因此
没有 MGF,还能研究标准化和吗
独立同分布变量 X1,X2,… 的密度为 3/x4,。有人说它们没有零点邻域内有限的 MGF,因此不能应用中心极限定理。判断这句话,并写出正确的标准化表达式。
这句话把一种证明工具的适用条件,当成了定理本身的条件。正文已经算出 E[X1]=3/2,Var(X1)=3/4,符合独立同分布中心极限定理的有限正方差要求。
相应的标准化和为
下一章会暂时从“完整识别分布”退一步:如果只知道均值或方差,能不能控制一次偏离的概率?随后我们把这些概率界用于越来越长的样本序列,明确“趋近”有哪些含义,并证明样本均值为何稳定。等收敛概念讲清楚,本章特征函数留下的那条推导就能接上中心极限定理的完整概率解释。