期望、方差、矩与分布摘要
上一章里,我们已经能用一个密度函数描述等待时间,也能用几个参数区分均匀、指数、正态、Gamma 和 Beta 分布。但如果有人只问“平均要等多久”,让他看一整条密度曲线,似乎有点绕。我们需要从完整分布里取出一个数,直接回答这个问题。
这个数就是期望。它看起来只是加权平均,却会把前面几章的内容连起来:随机变量负责把实验结果翻译成数字,分布负责记录这些数字各带多少概率,期望再把这些概率当成权重,算出一个平衡位置。接下来,方差会告诉我们概率质量离这个位置多远,矩则继续观察偏斜和较大偏离。
我们也要始终留着一个疑问:把整份分布压成几个数,究竟丢掉了什么?知道两个随机变量的均值、方差相同,并不意味着它们的分布相同;知道它们各自怎样波动,也还不知道它们会不会一起偏大。这条线索会把我们带到下一章的联合分布。
平均之前,先问每个结果该占多大分量
设一个积分活动有三种奖励:有 70% 的概率获得 0 分,有 20% 的概率获得 6 分,有 10% 的概率获得 18 分。令 X 表示一次活动获得的积分。
把三个数简单平均,会得到 (0+6+18)/3=8。问题在于,这个算法偷偷给三种结果各分配了三分之一的权重。实际最常出现的是 0 分,它应当占七成分量;18 分虽然大,却只有一成机会出现。
按概率加权,平均积分应当是
E(X)=0×0.7+6×0.2+18×0.1=3.
先别把这句话理解成“玩一次应该得到 3 分”。这个活动压根没有 3 分这个结果。期望是分布的平均位置,完全可以落在两个可能取值之间,也可以落在一次都不可能取到的位置。
把这笔账分成“收益”“权重”和“贡献”三行,可以看到每个结果究竟给平均值贡献了多少。期望落在 3,并不要求游戏某次真的发出 3 元奖励。
期望按概率加权:E(X)=0×0.7+6×0.2+18×0.1=3。这个3不属于任何一次实际可能获得的奖励。
从普通平均走到概率加权
假如已经记录了 N 次活动,其中 0 分出现 n0 次、6 分出现 n6 次、 分出现 次,那么这批实际数据的平均值为
xN=N0n
普通平均其实也在加权,只不过权重是这批数据里的实际频率。期望把权重换成模型给定的概率,所以它在拿到数据之前就已经确定。数据平均会随抽到的样本改变,模型期望不会随着某一次抽样改变。
在导论课里,“做很多次,平均数就会靠近这个数”可能只是帮助理解的一句话。这里先把两件事分开:期望由分布定义;样本平均为什么会逼近期望,需要大数定律证明。 后面我们会在独立同分布、绝对可积等条件下把这笔账补上。有限次试验没有必须达到的平均值,偏差也不会随着每多做一次就单调缩小。
离散期望与重心
若离散随机变量的不同取值为 x1,x2,…,相应概率为 p1,p,且满足绝对可积条件,那么
E(X)=i∑xipi
有限个取值、每个取值都是有限实数时,第二个条件自动满足。无限多个取值时,我们很快就会看到它为什么不能省。
把 pi 想成放在数轴位置 xi 上的质量,所有质量加起来是 1。如果支点放在 μ=E(X,有向力矩的总和就是
i∑(xi−μ)pi
这就是“期望是重心”的准确含义。它没有说每块质量都靠近支点,只说左右的有向力矩相互平衡。一个很远的位置即使只有很少的概率,也可能对重心产生明显影响。
均值也不等于众数或中位数。积分活动的众数是 0,因为它出现概率最大;0 也是一个中位数,因为它左右两侧分别包含至少一半概率;均值却是 3。三个量回答的分别是“哪一个值最常见”“哪里把概率分到两边”“按概率加权后在哪里平衡”。
连续分布里,权重变成一小段概率质量
上一章一直提醒我们:密度的高度不是某个点的概率。这句话在计算期望时同样要保留。若 X 有密度 fX,那么有限期望的公式是
E(X)=∫−∞∞xf
可以先把数轴划成很短的小区间。区间 [x,x+Δx] 上的概率近似为 fX(x)Δx,这一小段对平均的贡献近似为 xf。把所有小段加起来,再把分割做得越来越细,就得到积分。
这里始终是“位置乘概率质量”。不能把密度高度当作概率直接乘上去,也不能把整条曲线上若干等距采样点的横坐标直接平均。
一段不断增大的等待密度
设某个简化服务模型中的等待时间 T 只能落在 0 到 3 分钟之间,密度为
fT(t)=⎩⎨
先检查这确实是一份分布:函数非负,而且
∫0392tdt=[
若区间内各处密度相同,期望会在中点 1.5 分钟。现在密度向右增大,右边带着更多概率,重心应当被拉到中点右侧。算下来,
E(T)=∫03t92t
结果是 2 分钟,与密度形状给出的判断一致。先用图形或取值范围判断结果应该大致在哪里,再做积分,是很有效的自检。如果这里算出了 4 分钟,甚至不用重算,就知道答案不可能对:一个始终落在 [0,3] 内的随机变量,其有限期望也一定落在这个区间内。
有跳点,也有密度,怎么算
有些等待时间一部分概率集中在 0:到达时恰好没有排队,立即获得服务。其余情况才有正的等待时间。假设 P(T=0)=0.4;在确实需要等待的情形下,等待时间在 [1,5] 上均匀分布。
此时 T 不是纯粹的离散型,也没有覆盖全部概率的普通密度。正半轴上的连续部分密度为 0.6/4=0.15,但它只积出 0.6,剩下的 0.4 在零点。于是
E(T)=0×0.4+∫15t×0.15dt
只积分连续部分,在这个例子里恰好仍得到正确期望,是因为零点的贡献为零;若离散质量放在别的位置,漏掉它就会出错。统一地,我们可以写成
E(X)=∫RxdFX(x).
这里的积分是对分布的概率质量积分,它同时照顾跳点、密度部分和其他类型的分布。现阶段遇到明确给出的混合模型,把各部分分别加权即可,不需要为了套某一种公式把混合分布硬说成连续分布。
期望能不能算,取决于尾部能不能收住
有界随机变量的期望不会出问题,麻烦通常出在无限远。概率越来越小,并不自动保证期望有限,因为与概率相乘的取值可能长得更快。
设 N 是一个取正整数的随机变量,满足
P(N=n)=n(n+1)1,n=1,2
这是合法分布,因为 1/[n(n+1)]=1/n−1/(n+1),前 m 项的概率和为 1,极限为 。可是
E(N)=n=1∑∞n(n+
每次抽到的 N 都是一个有限整数,但其非负期望是 +∞。这两件事不矛盾:前者说每个结果落在哪里,后者说把无穷多个可能结果的加权贡献累计起来会怎样。
正负抵消为什么不能靠对称蒙混过去
对于可正可负的随机变量,先定义正部和负部:
X+=max(X,0),X−=max(−X,0).
它们都非负,并且
X=X+−X−,∣X∣=X++
所以自然希望把期望定义为 E(X+)−E(X−)。若两部分都是有限数,减法没有歧义,这恰好等价于 E(∣X∣)<∞。若只有一边无穷,可以得到扩展意义的 或 。若两边都是无穷,期望就没有定义,不能做“无穷减无穷”。
在刚才的 N 上再加一个正负对称的符号,定义 X 的分布为
P(X=n)=P(X=−n)=2n(n+1)
看着这份分布,你可能会说:“完全对称,那期望肯定是 0。”但它的正部期望和负部期望分别是
E(X+)=E(X−)=2
因此 E(X) 未定义。把 n 和 −n 逐对消掉所得的 0,只反映你采用了一种对称截断方式,不是通常意义下的期望。
连续情形也会出现同样问题。例如密度 f(x)=1/[π(1+x2)] 关于零对称,但
∫0Mπ(1+x2)
负半轴对应的负部积分也无穷。对称区间上的积分始终是 0,得到的是柯西主值,不能把它当成这个分布的期望。
“由对称性可得均值为零”前面需要一个检查:均值是否存在。绝对可积后,对称性才能安全地帮助计算。下面涉及有限期望的线性运算,默认相关随机变量都绝对可积。
想算变换后的平均,不必先求新分布
现在回到有界、可计算的模型。等待时间 T 的分布已知,但我们真正关心的可能是费用 g(T),而不是时间本身。你当然可以先求费用的分布,再按定义求期望;只是很多时候,这会绕远路。
对于可测函数 g,若 g(X) 绝对可积,就有
E[g(X)]=i∑g(xi)pi
以及在 X 有密度时,
E[g(X)]=∫−∞∞g(x)fX
若 g≥0,这些公式也允许结果为 +∞。这条计算规则常被简称为 LOTUS。它让我们仍沿着 X 的取值逐项计算:出现 x 时,目标量是多少,就把 g(x) 乘上这件事的概率。
多个输入变成同一个输出,为什么不会重复计算
假设 Y=g(X)。对离散变量,输出为 y 的概率等于所有满足 g(x)=y 的输入概率之和。因此
E(Y)
第一种算法先把相同输出合并,第二种算法保留每个输入直接计入贡献,两者只差一个分组顺序。绝对可积保证无限求和时这种重排安全。公式没有要求 g 单调,也没有要求它可逆。
例如 X 以概率 1/4,1/2,1/4 分别取 −2,0,2。计算 E(X2) 时,两个不同输入 和 都变成 。直接计算得到
E(X2)=4×41+0×
也可以先发现 X2 以概率 1/2 取 4、以概率 1/2 取 0,结果一样。这里变换后的分布确实变了,但算平均时不必先把它完整写出来。
分段收费:别把平均时间直接代入价目表
继续使用密度 fT(t)=2t/9、0<t<3 的等待模型。设一项补偿规则是:等待不超过 1 分钟时不补偿,超过后每多等一分钟补偿 个积分。补偿量为
C=g(T)=4(T−1)+,(u)
费用在零点有一块概率质量,因为 T≤1 都产生相同的输出 0。若先求 C 的完整分布,就要同时处理跳点与连续部分。求期望却只需沿着时间加权:
E(C)
平均补偿约为 4.148 个积分。前面已经算出 E(T)=2,若直接把它代入补偿规则,只能得到 g(E(T))=4。两者不同,因为把不同等待时间先合并成一个平均数,会抹去它们分别落在收费门槛哪一边的信息。
这不是计算误差,而是非线性函数的普遍现象。我们稍后会用 Jensen 不等式解释:这个例子中,为什么“先算补偿再平均”一定不会小于“先平均再算补偿”。
总量的期望,可以直接拆开算
非线性变换需要小心,线性运算却有一条非常稳定的规则。若 X1,…,Xn 绝对可积,a1, 是常数,那么
E(i=1∑naiX
这里不要求独立。 这句话值得真正理解,而不只是记在公式旁边。无论变量之间怎样关联,对同一个实验结果而言,先把它们相加再加权,与各自加权后相加,都是分配律。
在有限样本空间里,直接写出来就是
E
证明里从未拆分某个联合概率,因此没有用到独立性。一般概率空间里的证明是同样的积分线性性。三角不等式还保证 E∣X+Y∣≤E∣X∣+E∣Y∣<∞,所以相加之后的有限期望确实存在。
这里说的是有限项求和。遇到无穷多个随机变量相加,不能只把求和号拉出去就算完成;非负项可以利用单调收敛,带符号的项则需要额外的可积条件。有限项规则已经足够解决本章的大多数计数问题。
指示变量把计数拆成一次次贡献
对事件 A,定义指示变量
IA={1,0,A
它只回答一个是非问题,所以期望为
E(IA)=1×P(A)+0×P(A
如果总数 K 统计一组事件中发生了多少个,那么 K=∑iIAi,从而 。我们不必先知道“恰好发生三个事件”的概率是多少,只需要知道每一项贡献发生的概率。
每盏灯只贡献零或一,总数的期望可以逐项计算;这一步不要求各盏灯独立。
一个有依赖关系的座位问题
有 12 名同学在 12 个编号座位上等可能随机落座,其中 5 名同学参加同一社团。令 K 表示前 4 个座位上该社团同学的人数。
定义 Ij:第 j 个座位坐着社团同学时取 1,否则取 0,其中 j=1,。由对称性,每个座位坐着社团同学的概率都是 ,因此
E(K)=j=1∑4E(Ij)=
这四个指示变量并不独立。若已经知道第一个座位坐着社团同学,那么第二个座位的相应概率变为 4/11,不是原来的 5/12。它们的关联会影响人数分布和波动,却不会妨碍刚才的期望计算。
同一种想法还可以数随机排列中的固定点。若 n 个编号物品等可能排列,第 i 件恰好回到原位的概率为 1/n,固定点总数的期望就是 n×1/n=1。重点不是这个答案恰好为 1,而是遇到复杂计数时,我们找到了一个常常比求完整分布更短的入口。
加法规则不能偷换成乘法规则
一般来说,E(XY) 不等于 E(X)E(Y)。例如 X 是成功概率为 0.3 的指示变量,令 Y=。无论发生什么,,于是
E(XY)=0,E(X)E(Y)=0.3×0.7=0.21.
如果 X,Y 独立并且都绝对可积,才可以保证 XY 也绝对可积并得到 E(XY)=E(X)E(Y)。下一章会从联合分布分解的角度证明它。暂时把两条规则放在各自的位置:有限期望相加不需要独立;独立性则是乘积期望可分解的一项充分条件。
方差:让偏离均值的距离也参与平均
两台计量装置的读数都以 10 为平均值。一台以相同概率读出 9 或 11,另一台以相同概率读出 2 或 18。均值完全一样,但第二台显然更不稳定。
直接算平均偏差没有用,因为只要 μ=E(X) 有限,就有 E(X−μ)=0。正偏差和负偏差会抵消,即使读数非常分散,结果还是零。我们需要先把偏差变成非负量,再取平均。
绝对偏差 E∣X−μ∣ 是一种选择。方差采用平方偏差,定义为
Var(X)=E[(X−μ)2],μ=E(X).
平方让方向相反的偏离不能抵消,也让大偏离受到更高的权重:偏离从 2 增大到 4,平方贡献从 4 增大到 16。刚才两台装置的方差分别为 1 和 64。
谈有限方差时,需要 E(X2)<∞。这也自动保证有限期望,因为 ∣x∣≤1+x2,于是 。如果均值有限而二阶矩无穷,可以把平方偏差的期望记作 ;如果均值本身未定义,就不能照常围绕它定义方差。
图中是两份对称分布的示意比较:中心相同,平均平方偏离不同。它不表示任意分布的均值都位于峰顶。
一个更省事的计算公式
在二阶矩有限的条件下,把平方展开:
Var(X)
这个式子里有两个非常容易混淆的量。E(X2) 是先把每个结果平方,再按概率平均;[E(X)]2 是先平均,再把那个数平方。它们的差正好就是方差。
回到积分活动,X 以概率 0.7,0.2,0.1 取 0,6,18,我们已知 E(X)=3。二阶矩为
E(X2)=02×0.7+62×0.2
因此
Var(X)=39.6−32=30.6.
若按定义检查,则分别计算 (0−3)2,(6−3)2,(18−3)2,得到
9×0.7+9×0.2+225×0.1=30.6.
两种方法相符。后一种写法还能看出,虽然 18 分只占一成概率,它与均值相距很远,对方差的贡献达到 22.5,占了大部分。
标准差、平移与单位变换
方差的单位是原单位的平方。若 X 以分钟计时,方差就是平方分钟;为了回到原来的单位,我们取平方根,定义标准差
σX=Var(X).
标准差是平方偏差平均后的平方根,并不等于平均绝对偏差。也不能仅凭“一个标准差”就断言某个固定比例的结果落在均值附近;正态分布的那些比例需要正态模型支持。
若 Y=aX+b,那么
Y−E(Y)=aX+b−(aμ+b)=a(X−
所以
Var(aX+b)=a2Var(X),σaX
给每个等待时间加 2 分钟,均值增加 2,各次等待与新均值的距离不变,方差也不变。把分钟换成秒,相当于乘 60,标准差乘 60,方差乘 3600。这说明方差不是线性函数,不能照抄期望的运算规则。
均值为什么恰好是平方误差下最好的单个预测值
如果必须用一个常数 c 预测 X,怎样让平均平方误差最小?设二阶矩有限,把 X−c 写成 (X−μ)+(μ−c),展开后有
E[(X−c)2]
第一项与选择 c 无关,第二项在且仅在 c=μ 时达到零。因此,均值是使平均平方误差最小的常数。方差就是用这个最优常数预测后仍然留下的平均平方误差。
这也解释了“平均值适合代表数据”背后的一个具体标准:我们选择了平方损失。若换成绝对误差,最优常数会与中位数有关。哪个摘要合适,要看我们用什么方式评价偏差。
多次平均为什么能变稳,先从方差看出线索
期望可以直接相加,方差却要检查变量之间的关系。设 X,Y 都有有限二阶矩,记 μX=E(X)、μY。直接展开得到
Var(X+Y)=Var
最后一项反映两者的偏差是否倾向于同号。如果 X,Y 独立,乘积期望可以分解,最后一项就是 2E(X−μX)E(Y−μ,于是方差可以相加。不独立时,这一项一般不能删掉。
最直接的反例是令 Y=X,并设 Var(X)=1。那么 X+Y=2X,方差为 4,不是 。若令 ,总和恒为零,方差又变成 。两种情况里各自的方差都为 ,但一起变化的方式完全不同。
现在假设 X1,…,Xn 独立同分布,均值为 μ,方差为有限数 σ2。对于总和 和样本平均 ,有
Sn=i=1∑nXi
E(Sn)=nμ,Var(Sn)=nσ
E(Xn)=μ,Var(
总和的绝对波动在增大,但除以 n 之后,平均数的波动在缩小。这正是我们以后证明“大量独立重复的平均会稳定”的一条路线。若想把标准差减半,需要把样本数增到原来的四倍,而不是两倍。
如果每次记录的其实是同一个 X,即所有 Xi=X,平均仍然等于 X,方差不会缩小。仅仅增加记录条数,并不自动增加独立信息。另一个条件也别遗漏:独立性不会让一个原本没有有限方差的分布突然有了有限方差,上面这组有限数公式不能无条件套到重尾模型上。
矩继续提问:离原点多远,向哪边偏,远处有多重
期望是一次幂的平均,方差是中心化后的二次幂平均。沿着同样思路,第 k 阶原点矩与中心矩分别是
mk=E(Xk),μk=
讨论有限的第 k 阶矩时,我们要求 E∣X∣k<∞。原点矩参照数轴上的零,中心矩参照自己的均值。第一阶原点矩就是均值,第一阶中心矩为零,第二阶中心矩就是方差。
若 0<σ2<∞,还可以把距离除以标准差,得到无单位的标准化变量 Z=(X−μ)/σ。只要相应阶数的绝对矩有限,标准化矩为 。不同单位下的数据由此可以在相同尺度上比较。
偏度记录有向的立方贡献
三阶标准化矩称为偏度:
γ1=E[(σX−μ)
立方保留正负号,又加重较远偏离的贡献。正偏度表示正方向的立方贡献压过负方向;负偏度相反。把它粗略说成“尾巴往哪边拖”有一定直觉,但准确判断仍要看整个分布,不能仅凭偏度的符号就推出每一个尾概率的大小关系。
若分布关于均值对称,且三阶绝对矩有限,则成对的奇次贡献相消,偏度为零。反过来,偏度为零不保证分布对称:一个数值等式不足以锁定整份形状。
峰度放大远离均值的贡献
四阶标准化矩称为峰度:
β2=E[(σX−μ)
有时使用超额峰度 γ2=β2−3,把正态分布的峰度 3 平移到零。报告数值时要说清使用哪一个定义。
峰度的名字容易让人只盯着曲线顶端的尖或平。公式实际计算的是标准化偏离的四次方,所以很远但很少见的结果也能产生巨大贡献。峰度大,不等于“在每一个阈值之外的概率都更大”,也不能从一个峰度值恢复完整尾部。
看两个均值、方差都相同的分布。A 以相同概率取 −1 和 1;B 以概率 1/8,3/4,1/8 分别取 −2,0。它们都关于零对称,而且
E(A)=E(B)=0,E(A2)=E(B
可是它们的四阶矩分别为
E(A4)=1,E(B4)=16×4
B 的四阶矩更大,说明其较远位置带来更多四次方贡献。若阈值为 1.5,确实有 P(∣B∣>1.5)=1/4>P(∣A∣>1.5);但若阈值为 ,方向反过来,。均值、方差、峰度都只是摘要,不能替我们回答所有阈值上的问题。
重尾分布的每一阶矩都有自己的门槛
设 R 的密度为
fR(r)=rα+1α
在其他地方为零。对 k>0,
E(Rk)=α∫1∞rk−
无穷积分收敛需要幂指数严格小于 −1,也就是 k<α。因此
E(Rk)={α
例如 α=3/2 时,均值为 3,但二阶矩无穷,方差也是无穷;α=3 时,均值为 3/2,二阶矩为 3,方差为 3/4,但第三阶矩已经发散。不能因为软件画出一条平滑曲线,就默认均值、方差、偏度、峰度都存在。
高阶绝对矩有限会保证低阶绝对矩有限,因为对 0<r<s 有 ∣x∣r≤1+∣x∣s。反方向不成立,刚才的分布就是明确反例。计算高阶摘要之前,先检查存在性,比在发散表达式上继续化简更重要。
常见分布的摘要,要从结构里找理由
前两章出现的几个分布,现在可以放进同一张表。表中的 Gamma 使用形状参数 α 和率参数 λ;几何分布统计第一次成功所需的总试验次数。
这张表适合检查答案,不适合代替推导。几何分布若改成统计成功前的失败次数,只是把总次数减一,所以期望变为 (1−p)/p,方差保持不变。Gamma 若使用尺度 θ=1/λ,相应公式变为 αθ 与 αθ。参数约定明确以后,这些差异都来自简单变换。
二项分布:先看到指示变量
设 S=I1+⋯+In,各 I 是独立的 Bernoulli 变量。由于 ,
E(Ii)=p,Var(Ii)
因此 E(S)=np,Var(S)=np(1−p)。期望的推导只用了相同边缘成功率;方差相加用到了独立性。若只知道每次成功率相同,却不知道相互关系,不能直接说总数服从二项分布。
在下面的实验台里,先固定 n=12,将 p 从 0 调到 1:均值从 0 走到 12,方差在两端为零,在 p 时最大。再固定 增大 ,观察总次数的标准差怎样变化,并用除以 后的公式判断成功比例的波动。
这个实验台展示的是独立、成功率相同的试验模型。数值框和柱上的概率提示给出计算结果;零概率位置保留极细的可交互标记,不能把那条基线痕迹读成正概率。图里的标准差也只是平方偏离的尺度,不承诺某个固定比例一定落在均值加减一个标准差内。
Poisson 分布:让阶乘帮我们约掉因子
对 N∼Poisson(λ),从定义算期望时,n 恰好能约掉 n! 的一部分:
E(N)=n=1∑∞ne
右边的和重新编号后,是一份 Poisson 概率的总和,所以等于 1。二阶矩可以先绕到 N(N−1):
E[N(N−1)]=λ2,N2=N(N−
于是 E(N2)=λ2+λ,减去均值平方后,方差为 λ。这里先算的量叫二阶阶乘矩,它说明“换一个更容易计算的多项式”有时比直接处理 n 更省力。
指数分布:一次分部积分带出整串矩
对率为 λ 的指数变量 T,记
Mk=E(Tk)=∫0
对正整数 k 做分部积分,边界项为零,得到
Mk=[−tke
从 M0=1 出发,得到 M1=1/λ、M,所以方差为 。率越大,平均等待越短,标准差也越小,这与上一章的等待模型一致。
Jensen 不等式:非线性为什么改变平均
前面的分段补偿例子里,我们发现 E[g(T)]>g(E(T))。这种差别不总是同一个方向,但当函数具有凸性时,方向可以确定。
凸函数满足:对定义区间内的 x,y 以及 0≤t≤1,
g(tx+(1−t)y)≤tg(x)+(1−t)g(y).
几何上,曲线上两点之间的连线位于曲线上方或与它重合。代数上,先对输入加权平均再代入函数,结果不超过先代入函数再加权平均。你会发现,这个定义本身就已经像一个只含两个取值的期望不等式。
若 X 落在凸函数 g 的定义区间内,且 E∣X∣<∞、E∣g(X)∣<∞,那么 Jensen 不等式给出
g(E(X))≤E[g(X)].
凹函数的不等号方向相反。我们这里先使用两边都有限的版本,避免把重点分散到扩展值的约定上。
证明的关键,是在均值处放一条支撑直线
先看 g 在 μ=E(X) 处可微、且 μ 在定义区间内部的情况。凸函数的图像不低于这点的切线,所以对所有允许的 x,
g(x)≥g(μ)+g′(μ)(x−μ).
把 x 换成随机变量 X,再利用期望的单调性与线性性,有
E[g(X)]
均值处的线性偏差平均为零,所以切线在平均后只留下 g(μ);曲线在切线上面的部分则不会产生负贡献。不可微时,用均值处的一条支撑直线替代切线,推导完全一样。若均值位于取值区间的端点,随机变量只能几乎处处等于该端点,结论直接成立。
平方、门槛与收益递减
取 g(x)=x2,就得到 [E(X)]2≤E(X,差值正是方差。若 严格凸,在这里的可积条件下,等号只有当 几乎处处为常数时成立。对于平方,这就是方差为零等价于 。
分段补偿 g(t)=4(t−1)+ 也是凸函数,因为它在门槛左边斜率为 0,右边为 4,斜率向上跳。因此 Jensen 保证平均补偿至少等于对平均等待计算的补偿。这个函数并非严格凸:若等待时间全部落在同一个线性区间内,即使存在波动,也可能取等号。
再看 g(x)=logx,它在正半轴是凹函数。对正随机变量 X,在 E(X) 有限且 E∣logX∣< 时,有
E(logX)≤logE(X).
例如 X 以相同概率取 1 和 9,则 E(logX)=log3,而 logE。对数对大值的增量反应越来越弱,因此先让两个结果各自经过对数变换,再平均,会得到更小的数。非线性平均不能靠“把期望搬进去”解决,函数的形状与可积条件都要看。
平均相同,仍然可能是很不同的风险
设两个简化收益模型为:X 恒等于 2;Y 以概率 0.1 取 −16,以概率 0.9 取 4。它们的均值精确相同:
E(X)=2,E(Y)=−16×0.1+4×0.9=2.
但 X 的方差为零,而
Var(Y)=(−16−2)2×0.1+(4−2)
更直接的问题是“会不会亏损”:P(X<0)=0,P(Y<0)=0.1。如果关心的是亏损超过 10 个单位,仍然应当明确计算相应尾概率,不能让“均值相同”掩盖结果的差异。
这一章的摘要量可以一起使用,但各自职责不同。均值是加权平衡位置,方差是平均平方偏离,偏度与峰度记录更高次的偏离贡献,分位数与尾概率则直接面对给定门槛。没有哪一个数能够单独代表完整分布。
我们现在也能更准确地说“同分布”的作用:若两个变量同分布,那么可积的同一个函数变换具有相同期望;但这没有告诉我们,把两个变量放在同一个实验里,它们会怎样配对出现。接下来的联合分布,正是要把这部分信息补回来。
把定义、条件和计算放在一起练习
练习一:同一份积分的两种摘要
一次抽取的积分 X 以概率 1/2,1/3,1/6 分别取 −2,1,10。求均值、二阶矩、方差与标准差,并说明均值是不是最常出现的值。
先按各自的概率加权:
E(X)=−2×21+1×3
练习二:不求新分布,直接算费用
设 U∼Uniform(0,4),费用 C 为 3(U−2)+。求 ,再与把平均用量代入费用函数得到的结果比较。
当 U≤2 时费用为零;其余时候沿着 U 的密度 1/4 积分:
E(C)
练习三:把依赖关系留在正确的位置
某次抽签从 15 人中等可能选出 6 人,其中有 4 人来自同一小组。令 K 为被选中的该小组人数。不求 K 的完整分布,计算 E(K)。四个人是否被选中,相互独立吗?
对小组内第 i 个人定义入选指示变量 Ii。每个人入选概率为 6/15,而 K=I,所以
练习四:哪些矩真的存在
非负变量 R 的密度为 f(r)=25r−7/2,。求均值、方差,并判断能否使用有限偏度和峰度。
这是形状参数 α=5/2 的重尾模型,只有阶数小于 5/2 的矩有限。因此
E(R)=
练习五:四个读数真的带来四份信息吗
某个读数 X 的均值为 8、方差为 9。方案甲独立测量四次,取均值 A;方案乙只测量一次,把同一个值复制四份再取均值 B。求 E(A),。
方案甲的四个读数独立同分布,因此
E(A)=8,Var(A)=49.方案乙满足 ,所以
练习六:用平方误差理解均值
设 E(X)=3、Var(X)=4。用常数 c=1 预测 X 时,平均平方误差是多少?如果只要求预测值是一个常数,最小能达到多少?
利用误差分解,
E[(X−1)2]=Var(X)+(E(X)−1)
现在,我们已经会从一个分布提取平均位置和波动,也知道哪些摘要可能根本不存在。下一步把两个变量放在一起:仅知道各自均值、方差,甚至知道各自完整分布,仍无法判断它们的和会怎样波动。要回答这个问题,我们必须记录它们怎样同时取值,这就是联合分布要接手的工作。