中心极限定理、正态近似与综合建模
上一章已经替我们解决了一个悬了很久的问题:独立重复试验时,为什么频率会靠近概率,样本均值会靠近期望。过去凭直觉接受的“多做几次就会稳定”,终于有了大数定律作依据。不过,“会靠近”还没有回答另一件实际问题:做了这么多次,现在剩下的误差大约有多大?偏高和偏低的可能性又怎样分配?
例如,一次服务的耗时可能很不对称:大多数订单几分钟就完成,少数订单要等很久。一天完成几百个订单以后,平均耗时通常稳定了,但它不可能每次都刚好等于理论均值。我们要研究的,就是平均值周围这团还在晃动的误差。
中心极限定理把镜头对准这团误差。它先减去中心,再按误差本来的大小调整刻度,最后发现:对于独立同分布、方差有限且不为零的观测,这个经过调整的误差分布趋向标准正态分布。单次服务可以依旧右偏,硬币结果可以始终只有两个值;改变形状的是许多观测的和或平均值。
这一章会把“趋向”真正写清楚,也会追问为什么偏偏是正态分布。等我们把证明走完,再回来算抽样误差、计数概率和模拟误差,就能知道每一步近似借用了哪些条件。
平均值越来越稳,误差为什么还值得研究
先看一个很熟悉的模型。独立抛掷正面概率为 p p p 的硬币,用 X i X_i X i 记录第 i i i 次是否正面,正面记 1 1 1 ,反面记 0 0 0 。正面比例就是
X ˉ n = X 1 + ⋯ + X n n . \bar X_n=\frac{X_1+\cdots+X_n}{n}. X ˉ n = n X 1 +
大数定律说,对任何固定的容许误差 ε > 0 \varepsilon>0 ε > 0 ,
P ( ∣ X ˉ n − p ∣ > ε ) ⟶ 0. P(|\bar X_n-p|>\varepsilon)\longrightarrow0. P ( ∣ X ˉ n − p ∣ > ε ) ⟶ 0.
这里的关键词是“固定”。如果容许误差一直是 0.05 0.05 0.05 ,随着次数增加,超出这个范围越来越少见。可是实际工作往往会继续提高要求:做得越多,就想分辨越小的误差。我们能不能把观察窗口也随 n n n 缩小,看清平均值内部仍然存在的波动?
这时方差提供了一条线索。单次硬币结果的方差是 p ( 1 − p ) p(1-p) p ( 1 − p ) ;独立性使不同次之间的协方差为零,因此
Var ( X ˉ n ) = p ( 1 − p ) n , SD ( X ˉ n ) = p ( 1 − p ) n . \operatorname{Var}(\bar X_n)=\frac{p(1-p)}{n},
\qquad
\operatorname{SD}(\bar X_n)=\sqrt{\frac{p(1-p)}{n}}. Var ( X ˉ n ) = n
所以,一个与误差自然大小相配的窗口是“中心左右若干个标准差”。对于公平硬币,抛 100 100 100 次时比例的标准差是 0.05 0.05 0.05 ;抛 10 000 10\,000 10 000 次时变成 0.005 0.005 0.005 。窗口缩小了十倍,次数却增加了一百倍。这不是计算失误:标准差按平方根缩小。
如果我们把误差除以各自的标准差,就能比较两个实验。原来 0.05 0.05 0.05 的误差与后来 0.005 0.005 0.005 的误差,都相当于“离中心一个标准差”。中心极限定理关心的正是这把统一刻度尺上的分布。
大数定律与中心极限定理因而并不重复:前者说明固定窗口外的概率趋于零,后者刻画按 1 / n 1/\sqrt n 1/ n 缩小的窗口里,概率怎样分配。前者看平均值的稳定,后者放大稳定过程中留下的波动。
先把中心和尺度算对
把硬币推广成一般观测。设 X 1 , X 2 , … X_1,X_2,\ldots X 1 , X 2 , … 独立同分布,且
E ( X i ) = μ , Var ( X i ) = σ 2 , 0 < σ 2 < ∞ . E(X_i)=\mu,\qquad \operatorname{Var}(X_i)=\sigma^2,
\qquad 0<\sigma^2<\infty. E ( X i ) = μ , Var ( X i ) = σ
我们同时保留总和与均值两种写法:
S n = ∑ i = 1 n X i , X ˉ n = S n n . S_n=\sum_{i=1}^nX_i,
\qquad
\bar X_n=\frac{S_n}{n}. S n = i = 1 ∑ n X i
期望线性性不需要独立性,直接给出 E ( S n ) = n μ E(S_n)=n\mu E ( S n ) = n μ 。方差这一步则必须留意联合关系。一般来说,
Var ( S n ) = ∑ i = 1 n Var ( X i ) + 2 ∑ i < j Cov ( X i , X j ) . \operatorname{Var}(S_n)
=\sum_{i=1}^n\operatorname{Var}(X_i)
+2\sum_{i<j}\operatorname{Cov}(X_i,X_j). Var ( S n ) = i = 1 ∑ n
现在有独立性,协方差项才全部消失,得到 Var ( S n ) = n σ 2 \operatorname{Var}(S_n)=n\sigma^2 Var ( S n ) = n σ 2 。再用 Var ( a X ) = a 2 Var ( X ) \operatorname{Var}(aX)=a^2\operatorname{Var}(X) Var ( a X ) = ,就得到下面这张对照表。
总和的波动在变大,平均值的波动在变小,这两件事完全相容。总工作量增加时,超过平均总量几分钟并不奇怪;但分摊到每个订单以后,这几分钟的影响就小了。
标准化就是先减去对应的中心,再除以对应的标准差:
Z n = S n − n μ σ n = X ˉ n − μ σ / n = n ( X ˉ n − μ ) σ . Z_n=\frac{S_n-n\mu}{\sigma\sqrt n}
=\frac{\bar X_n-\mu}{\sigma/\sqrt n}
=\frac{\sqrt n(\bar X_n-\mu)}{\sigma}. Z n = σ n
请亲手核对中间那一步:把第一个分式的分子和分母同时除以 n n n ,就得到第二个。它们是同一个随机变量,不是两个不同的近似。
对每一个 n n n ,都有精确等式 E ( Z n ) = 0 E(Z_n)=0 E ( Z n ) = 0 、Var ( Z n ) = 1 \operatorname{Var}(Z_n)=1 Var ( Z n ) 。但均值为零、方差为一还不能推出正态分布;等概率取 和 的变量也有这两个性质。标准化只调整位置和尺度,分布趋于正态还需要后面的定理。
若观测单位是分钟,σ \sigma σ 和 σ n \sigma\sqrt n σ n 的单位仍是分钟,σ 2 \sigma^2 的单位则是分钟的平方。标准化以后应当没有单位。把方差当标准差放进分母,往往连单位也对不上。
把中心极限定理逐字读清楚
在刚才的独立同分布、有限正方差条件下,中心极限定理断言
Z n = S n − n μ σ n → d Z , Z ∼ N ( 0 , 1 ) . Z_n=\frac{S_n-n\mu}{\sigma\sqrt n}
\xrightarrow{d}Z,
\qquad Z\sim N(0,1). Z n = σ n
这里的 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) 用第二个参数表示方差。记标准正态分布函数为
Φ ( x ) = 1 2 π ∫ − ∞ x e − u 2 / 2 d u . \Phi(x)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^{x}e^{-u^2/2}\,du. Φ ( x ) = 2 π
由于 Φ \Phi Φ 处处连续,上面的依分布收敛等价于:对每一个实数 x x x ,
P ( Z n ≤ x ) ⟶ Φ ( x ) . P(Z_n\le x)\longrightarrow\Phi(x). P ( Z n ≤ x ) ⟶ Φ ( x ) .
于是,对固定的 a < b a<b a < b ,
P ( a < Z n ≤ b ) ⟶ Φ ( b ) − Φ ( a ) . P(a<Z_n\le b)\longrightarrow\Phi(b)-\Phi(a). P ( a < Z n ≤ b ) ⟶ Φ ( b ) − Φ ( a ) .
定理说的是分布函数和区间概率的趋近。它没有说某次模拟出来的 Z n Z_n Z n 数值会越来越接近某一个正态随机数,也没有要求所有 Z n Z_n Z n 的样本路径收敛。沿一条路径看到的标准化误差,仍然可以持续起伏。
离散的变量怎样趋近连续分布
如果每个 X i X_i X i 只能取 0 0 0 或 1 1 1 ,那么 S n S_n S n 永远是整数,Z n Z_n 对任何有限 都是离散变量。它怎么可能趋近连续的正态分布?
关键在于相邻格点的间距。标准化后,相邻成功次数之间相差
Δ z = 1 n p ( 1 − p ) . \Delta z=\frac{1}{\sqrt{np(1-p)}}. Δ z = n p ( 1 − p ) 1
固定 0 < p < 1 0<p<1 0 < p < 1 时,这个间距趋于零。单个格点仍然有概率质量,但大量越来越密的格点落在一个固定区间内,累加概率可以趋近正态曲线下的面积。依分布收敛允许每一步都离散,而极限是连续的。
因此,看到直方图接近钟形时,要读成“区间里的概率接近”。一般的中心极限定理不直接保证每个点的概率可以用密度值代替,也不直接保证原有密度逐点收敛。要研究单点概率或密度本身的细致近似,需要更强的局部结论。
三个条件分别排除了什么
“同分布”表示每次观测来自同一概率规律,使 μ \mu μ 、σ 2 \sigma^2 σ 2 始终对应同一个模型。“独立”控制它们如何一起出现,这件事不能只看单个分布判断。“方差有限且为正”保证 σ n \sigma\sqrt n σ n 是有意义的非零尺度。
如果 σ 2 = 0 \sigma^2=0 σ 2 = 0 ,那么 X i = μ X_i=\mu X i = μ 几乎处处成立,平均值没有随机波动,分母也不能再除以零。如果方差无限,这个版本的定理无从使用。如果观测互相依赖,即使每个边缘分布完全一样,也不能直接把方差相加。
反过来,原分布并不需要对称,不需要连续,不需要有密度,也不需要所有高阶矩都存在。一个分布可以右偏、带原子、带较长尾巴;只要满足本版条件,结论仍然成立。至于有限样本要等多久才能近似得好,定理暂时还没有给答案。
把这两种尺度并排看,就能接上上一章的大数定律:平均值本身越来越集中,中心极限定理则把缩小的波动重新放大,研究放大后的分布形状。右边画的是极限分布;有限样本的分布未必已经是一条正态曲线。
独立同分布且方差有限、非零时,样本均值围绕μ的波动尺度按σ/√n缩小。把这份波动放大到单位尺度后,标准化统计量的分布趋近N(0,1);有限样本及原始观测不因此必然正态。
为什么最后留下的是正态分布
我们在随机变量和的讨论里已经遇到过一个麻烦:卷积一次还好,连续卷积几十次,公式很快就难以处理。证明中心极限定理时,可以换到特征函数这一边,让“独立随机变量求和”变成“函数相乘”。下面把用到的性质和推导都展开,不必先记住整套特征函数理论。
对实随机变量 Y Y Y ,定义它的特征函数
φ Y ( t ) = E ( e i t Y ) = E ( cos ( t Y ) ) + i E ( sin ( t Y ) ) , t ∈ R . \varphi_Y(t)=E(e^{itY})
=E(\cos(tY))+iE(\sin(tY)),\qquad t\in\mathbb R. φ Y ( t ) = E ( e i t Y ) =
这里 i 2 = − 1 i^2=-1 i 2 = − 1 。因为 ∣ e i t Y ∣ = 1 |e^{itY}|=1 ∣ e i t Y ∣ = 1 ,这个期望始终存在。相比可能发散的矩母函数 E ( e t Y ) E(e^{tY}) E ( ,特征函数不会因为尾部较重就突然失去定义。
独立性给它带来了所需的运算性质。如果 Y 1 , … , Y n Y_1,\ldots,Y_n Y 1 , … , Y n 独立,那么
E ( e i t ( Y 1 + ⋯ + Y n ) ) = E ( ∏ j = 1 n e i t Y j ) = ∏ j = 1 n E ( e i t Y j ) . E\left(e^{it(Y_1+\cdots+Y_n)}\right)
=E\left(\prod_{j=1}^ne^{itY_j}\right)
=\prod_{j=1}^nE(e^{itY_j}). E ( e i t ( Y 1 + ⋯ + Y
这就是独立性在证明中真正工作的地方。若这些变量还同分布,右边就成为同一个特征函数的 n n n 次方。
有限二阶矩怎样决定零点附近的形状
先将单次观测标准化,令
Y i = X i − μ σ . Y_i=\frac{X_i-\mu}{\sigma}. Y i = σ X i − μ .
于是 E ( Y i ) = 0 E(Y_i)=0 E ( Y i ) = 0 、E ( Y i 2 ) = 1 E(Y_i^2)=1 E ( Y i 2 ) = 1 ,我们要研究的变量成为 。记 的特征函数为 。
从微积分的二阶展开出发,我们预计
φ ( u ) = 1 + i u E ( Y 1 ) − u 2 2 E ( Y 1 2 ) + o ( u 2 ) = 1 − u 2 2 + o ( u 2 ) , u → 0. \varphi(u)=1+iuE(Y_1)-\frac{u^2}{2}E(Y_1^2)+o(u^2)
=1-\frac{u^2}{2}+o(u^2),\qquad u\to0. φ ( u ) = 1 + i u E ( Y 1 ) −
这里 o ( u 2 ) o(u^2) o ( u 2 ) 的意思是余项除以 u 2 u^2 u 2 后趋于零。这个展开很像普通的泰勒公式,不过不能直接把每个样本的展开取期望以后就宣布成立:我们只假设二阶矩有限,并没有三阶矩条件,不能拿 E ∣ Y 1 ∣ 3 E|Y_1|^3 E ∣ Y 1 ∣ 去控制余项。
可以用一个更合适的余项写法。定义
r ( v ) = e i v − 1 − i v + v 2 / 2 v 2 ( v ≠ 0 ) , r ( 0 ) = 0. r(v)=\frac{e^{iv}-1-iv+v^2/2}{v^2}\quad(v\ne0),
\qquad r(0)=0. r ( v ) = v 2 e i v
二阶展开说明 r ( v ) → 0 r(v)\to0 r ( v ) → 0 当 v → 0 v\to0 v → 0 。而且 r r r 在整个实轴上有界:零点附近连续,远离零点时,分子各项除以 v 2 v^2 v 2 也都有界。于是
φ ( u ) − 1 + u 2 / 2 u 2 = E [ Y 1 2 r ( u Y 1 ) ] ⟶ 0. \frac{\varphi(u)-1+u^2/2}{u^2}
=E\bigl[Y_1^2r(uY_1)\bigr]\longrightarrow0. u 2 φ ( u ) − 1 + u 2 /2
最后的极限由控制收敛得到:对每个有限的 Y 1 Y_1 Y 1 取值,r ( u Y 1 ) r(uY_1) r ( u Y 1 ) 趋于零;其绝对值又不超过某个常数乘 Y 1 2 Y_1^2 Y 1 ,而 。这就说明有限二阶矩确实够用,没有在证明里悄悄多加一个条件。
把许多小因子乘起来
根据独立性与同分布性,
φ Z n ( t ) = [ φ ( t n ) ] n . \varphi_{Z_n}(t)
=\left[\varphi\left(\frac{t}{\sqrt n}\right)\right]^n. φ Z n ( t ) = [ φ (
固定 t t t ,令 n → ∞ n\to\infty n → ∞ ,每个因子的输入 t / n t/\sqrt n t / n 趋于零,刚才的展开正好适用:
φ Z n ( t ) = [ 1 − t 2 2 n + o ( 1 n ) ] n ⟶ e − t 2 / 2 . \varphi_{Z_n}(t)
=\left[1-\frac{t^2}{2n}+o\left(\frac1n\right)\right]^n
\longrightarrow e^{-t^2/2}. φ Z n ( t ) = [ 1 −
这一步使用的是熟悉的指数极限。更精确地,令括号中超过 1 1 1 的部分为 a n a_n a n ,则 n a n → − t 2 / 2 na_n\to-t^2/2 n a n → − t 2 、 。在 附近选取连续的复对数分支, ,所以 。即使中间因子是复数,极限仍然成立。
而 e − t 2 / 2 e^{-t^2/2} e − t 2 /2 恰好是标准正态分布的特征函数。特征函数的连续性定理告诉我们:若特征函数逐点趋于某个在零点连续的特征函数,对应分布就依分布收敛到它所确定的分布。应用这个结果,得到 Z n → d N ( 0 , 1 ) Z_n\xrightarrow{d}N(0,1) Z n d 。
现在回头看这段证明,正态分布出现的原因就不只是“很多图看起来像钟形”了。中心化消掉了一阶项,标准化把二阶项固定成 − u 2 / 2 -u^2/2 − u 2 /2 ,独立性把小因子相乘,最后指数极限留下 e − t 2 / 2 e^{-t^2/2} e − t 2 /2 。原分布的其他细节被收进余项,而余项在这套缩放下消失了。
这里确实使用了一个没有展开证明的桥梁——特征函数连续性定理。它负责从函数极限回到分布极限;前面的计算则解释了 CLT 的主要机制,以及为什么有限正方差会成为自然条件。
用模拟看见定理,也分清两个次数
下面的模拟器每次生成 n n n 个独立同分布观测,算出一个均值,再把这个过程重复 m m m 次。最后画出的直方图里有 m m m 个样本均值。这里有两种次数,含义完全不同。
增加 n n n ,改变的是每个均值的分布:标准差变成 σ / n \sigma/\sqrt n σ / n ,标准化后的分布也在趋于正态。增加 m m m ,只是更充分地观察这个已经确定的分布。若 n = 1 n=1 n = 且原分布只取两点,即使把 增大一百倍,也只是更清楚地看见那两个点,不会把原分布变成正态。
先选指数分布,保持重复次数不变,把样本量从 1 1 1 调到 10 10 10 ,再调到 100 100 100 。你会看到均值聚集在 1 1 1 周围,右偏逐渐减轻。图中横轴画的是原尺度的样本均值,叠加曲线对应 N ( μ , σ 2 / n ) N(\mu,\sigma^2/n) N ( μ , σ 2 / n ) ,并非每幅图都画标准正态。
再切换到偏斜两点分布:P ( X = 0 ) = 0.85 P(X=0)=0.85 P ( X = 0 ) = 0.85 、P ( X = 6 ) = 0.15 P(X=6)=0.15 P ( X = 6 ) = 0.15 。这里均值是 0.9 0.9 0.9 ,方差是 36 × 0.15 − 0.9 2 = 4.59 36\times0.15-0.9^2=4.59 。较小 时,均值仍落在间距 的格点上,直方图可能出现空档。格点与分组宽度共同决定柱形的外观;判断近似时,要同时看区间概率与理论标准差,不能只凭柱顶是否光滑。
模拟能帮助我们发现模式、检查计算,但没有代替证明。即使某次直方图恰好非常漂亮,它也只对应当前分布、当前参数与有限的随机样本。
从目标事件开始做正态近似
现在回到平均耗时、平均重量等计算。正确的顺序是先确定变量及其联合假设,写出目标事件,再用中心与尺度把这个事件翻译到标准正态尺上。
若题目问 S n ≤ c S_n\le c S n ≤ c ,标准化后的界限是 ( c − n μ ) / ( σ n ) (c-n\mu)/(\sigma\sqrt n) ( c − n μ ) / ( σ n ;若问 ,界限是 。两种写法可以互相转换,但原来那个 分别代表总量门槛与平均量门槛,不能混着代。
平均重量的误差
设一袋产品的重量均值为 500 500 500 克,标准差为 12 12 12 克。我们将抽到的 64 64 64 袋近似建模为独立同分布观测,估计平均重量落在 497 497 497 到 503 503 503 克之间的概率。
首先,均值和标准差有精确公式:
E ( X ˉ 64 ) = 500 , SD ( X ˉ 64 ) = 12 8 = 1.5. E(\bar X_{64})=500,
\qquad
\operatorname{SD}(\bar X_{64})=\frac{12}{8}=1.5. E ( X ˉ 64 ) = 500 , SD ( X ˉ
这里还没有使用正态近似。接下来,把事件等价改写:
P ( 497 ≤ X ˉ 64 ≤ 503 ) = P ( − 2 ≤ X ˉ 64 − 500 1.5 ≤ 2 ) . P(497\le\bar X_{64}\le503)
=P\left(-2\le\frac{\bar X_{64}-500}{1.5}\le2\right). P ( 497 ≤ X ˉ 64 ≤ 503 ) = P ( −
直到最后一步,我们才使用中心极限定理,把标准化均值的分布换成标准正态:
P ( 497 ≤ X ˉ 64 ≤ 503 ) ≈ Φ ( 2 ) − Φ ( − 2 ) ≈ 0.9545. P(497\le\bar X_{64}\le503)
\approx\Phi(2)-\Phi(-2)
\approx0.9545. P ( 497 ≤ X ˉ 64 ≤ 503 ) ≈ Φ ( 2 ) − Φ
这个约 95.45 % 95.45\% 95.45% 是模型下的近似概率。只知道均值和标准差,还不能保证 64 64 64 袋时近似误差一定很小;如果单袋重量本身正态,则独立正态变量的和仍正态,上面的正态计算对任何 n n n 都精确成立,最后的小数舍入除外。
上一章的切比雪夫不等式也能处理同一事件。它给出
P ( ∣ X ˉ 64 − 500 ∣ ≥ 3 ) ≤ 12 2 64 × 3 2 = 1 4 . P(|\bar X_{64}-500|\ge3)
\le\frac{12^2}{64\times3^2}=\frac14. P ( ∣ X ˉ 64 − 500∣ ≥ 3 ) ≤
这说明落在开区间 ( 497 , 503 ) (497,503) ( 497 , 503 ) 内的概率至少为 0.75 0.75 0.75 ,因而闭区间概率也至少为 0.75 0.75 0.75 。它比 0.9545 0.9545 0.9545 粗,却是仅凭这些矩条件得到的严格下界。正态近似提供更细的估计,两者承担的是不同任务。
为指定精度选择样本量
如果希望平均重量与 500 500 500 克之差不超过 ε \varepsilon ε ,且模型下的概率约为 95 % 95\% 95% ,正态近似会建议
1.96 σ n ≤ ε , n ≥ ( 1.96 σ ε ) 2 . 1.96\frac{\sigma}{\sqrt n}\le\varepsilon,
\qquad
n\ge\left(\frac{1.96\sigma}{\varepsilon}\right)^2. 1.96 n σ ≤ ε ,
取 σ = 12 \sigma=12 σ = 12 、ε = 2 \varepsilon=2 ε = 2 ,算得右边为 138.2976 138.2976 138.2976 ,向上取整得到 139 139 139 。这是在近似足够好前提下的样本量规划,不是只凭 CLT 就获得的有限样本保证。
如果需要仅靠方差的严格保证,切比雪夫要求 σ 2 / ( n ε 2 ) ≤ 0.05 \sigma^2/(n\varepsilon^2)\le0.05 σ 2 / ( n ε 2 ) ≤ 0.05 ,同样参数下得到 n ≥ 720 n\ge720 n ≥ 720 。这个差距很有教育意义:你想要“通常很有用的近似”还是“在所有满足矩条件的分布下都成立的保证”,会改变样本量答案。
二项分布:先对齐整数格子,再查正态面积
设 B n ∼ Bin ( n , p ) B_n\sim\operatorname{Bin}(n,p) B n ∼ Bin ( n , p ) ,其中 0 < p < 1 0<p<1 0 < p < 1 固定。把它写成 n n n 个独立伯努利变量的和,立刻得到
B n − n p n p ( 1 − p ) → d N ( 0 , 1 ) . \frac{B_n-np}{\sqrt{np(1-p)}}\xrightarrow{d}N(0,1). n p ( 1 − p ) B
因此,在近似适用时,可以用 Y ∼ N ( n p , n p ( 1 − p ) ) Y\sim N(np,np(1-p)) Y ∼ N ( n p , n p ( 1 − p )) 帮助计算计数概率。n p np n p 与 n ( 1 − p ) n(1-p) n ( 1 − p ) 都不太小,通常是一个有用的初筛条件;常见的 或 门槛都是经验准则,不是跨过以后误差就突然得到保证的开关。
为什么要两边都检查?即使试验次数很大,若预期成功次数只有几个,成功次数仍然明显右偏;若预期失败次数只有几个,则会明显左偏。只有 n n n 大,不足以消除这类偏斜。
连续性校正究竟在校正什么
把整数 k k k 上的概率想成放在小格子 [ k − 0.5 , k + 0.5 ) [k-0.5,k+0.5) [ k − 0.5 , k + 0.5 ) 内的一块面积。用正态曲线面积去近似时,包含整数 k k k ,就应当包含这整个小格子。
例如事件 45 ≤ B n ≤ 55 45\le B_n\le55 45 ≤ B n ≤ 55 包含从 45 45 45 到 55 55 55 的十一根柱子,它们合在一起覆盖 [ 44.5 , 55.5 ) [44.5,55.5) [ 44.5 , 55.5 ) 。因此我们用 近似。这半格移动针对的是离散事件边界,并没有改变二项分布的均值与方差。
对整数 a , b , k a,b,k a , b , k ,可以这样核对常见事件:
这里最容易出错的是“超过”与“至少”。先把文字改成准确的整数事件,再移动边界,远比背“加半还是减半”可靠。如果计数间距是 h h h ,相应半格是 h / 2 h/2 h /2 ;例如只能取偶数时不能直接照搬 0.5 0.5 0.5 。
至少 220 次成功
设 B ∼ Bin ( 400 , 0.52 ) B\sim\operatorname{Bin}(400,0.52) B ∼ Bin ( 400 , 0.52 ) 。它可以描述 400 400 400 次独立、成功概率固定的试验,例如一个设定好的抽样模型。我们求 P ( B ≥ 220 ) P(B\ge220) P ( B ≥ 220 ) 。
均值为 208 208 208 ,方差为 400 × 0.52 × 0.48 = 99.84 400\times0.52\times0.48=99.84 400 × 0.52 × 0.48 = 99.84 ,标准差约为 9.992 9.992 9.992 。连续性校正把门槛改成 219.5 219.5 219.5 ,于是
P ( B ≥ 220 ) ≈ 1 − Φ ( 219.5 − 208 99.84 ) ≈ 1 − Φ ( 1.1509 ) ≈ 0.1249. P(B\ge220)
\approx1-\Phi\left(\frac{219.5-208}{\sqrt{99.84}}\right)
\approx1-\Phi(1.1509)
\approx0.1249. P ( B ≥ 220 ) ≈ 1 − Φ ( 99.84
若不校正,就会把界限放在 220 220 220 ,标准化后约为 1.2010 1.2010 1.2010 ,得到约 0.1149 0.1149 0.1149 。这里半个计数单位使概率改变约一个百分点,所以它并非永远可以随手忽略的小修饰。
在比较器里先保持 n = 80 n=80 n = 80 、p = 0.35 p=0.35 p = 0.35 ,比较一段中心区间;随后让上下界相等,观察单点事件。未校正连续区间 [ a , a ] [a,a] [ a , a ] 的面积为零,却不代表 P ( B = a ) = 0 P(B=a)=0 P ( B = a ) = ,这时整格面积的作用尤其清楚。
再把 p p p 调到 0.01 0.01 0.01 ,观察精确值与近似值的差距。校正只能调整边界,不能把高度偏斜的分布变成对称分布。界面报告的是绝对误差;在极小尾概率处,还应比较误差占真实概率的比例。这里的精确二项值通过数值递推求得,仍有浮点舍入,显示六位小数的零也不表示数学上的严格零。
稀有成功时,另一个极限可能更合适
当 p p p 随 n n n 变化,例如 p n = 2 / n p_n=2/n p n = 2/ n ,虽然 n → ∞ n\to\infty n → ∞ ,却始终有 n p n = 2 np_n=2 。此时 趋向 ,不是方差不断扩展的正态形状。固定分布的 iid CLT 与这种“样本量改变时,单次分布也改变”的问题,不是同一个极限过程。
这也解释了二项近似的选择:成功和失败两侧都充足时可考虑正态;成功很稀少而次数很多时可考虑泊松;如果可以稳定地计算二项概率,直接计算往往更合适。近似的价值在于解释结构和简化计算,不在于替代已经容易得到的精确答案。
泊松分布:大参数为何接近正态
若 Q λ ∼ Pois ( λ ) Q_\lambda\sim\operatorname{Pois}(\lambda) Q λ ∼ Pois ( λ ) ,那么
E ( Q λ ) = Var ( Q λ ) = λ . E(Q_\lambda)=\operatorname{Var}(Q_\lambda)=\lambda. E ( Q λ ) = Var ( Q λ ) = λ .
我们已经知道独立泊松变量相加,参数也相加。特别地,当 λ \lambda λ 是正整数 m m m 时,可以在分布意义上把 Q m Q_m Q m 表示成 m m m 个独立 Pois ( 1 ) \operatorname{Pois}(1) Pois ( 1 ) 变量的和。对这个和使用 iid CLT,得到
Q m − m m → d N ( 0 , 1 ) . \frac{Q_m-m}{\sqrt m}\xrightarrow{d}N(0,1). m Q m
对于一般实数 λ → ∞ \lambda\to\infty λ → ∞ ,写 λ = m + r \lambda=m+r λ = m + r ,其中 m = ⌊ λ ⌋ m=\lfloor\lambda\rfloor m = ⌊ λ ⌋ 、0 ≤ r < 1 0\le r<1 0 ≤ 。在分布意义上将 拆成独立的 ,其中 。于是
Q λ − λ λ = m λ Q m − m m + R r − r λ . \frac{Q_\lambda-\lambda}{\sqrt\lambda}
=\sqrt{\frac m\lambda}\frac{Q_m-m}{\sqrt m}
+\frac{R_r-r}{\sqrt\lambda}. λ Q
第一个系数趋于 1 1 1 ,第二项的方差是 r / λ ≤ 1 / λ r/\lambda\le1/\lambda r / λ ≤ 1/ λ ,由切比雪夫不等式依概率趋于零。给依分布收敛的变量加上这样一个趋于零的小扰动,不会改变极限分布,所以一般参数下也有
Q λ − λ λ → d N ( 0 , 1 ) , λ → ∞ . \frac{Q_\lambda-\lambda}{\sqrt\lambda}\xrightarrow{d}N(0,1),
\qquad \lambda\to\infty. λ Q λ
因此,大参数时使用 N ( λ , λ ) N(\lambda,\lambda) N ( λ , λ ) 近似并不是另外背下来的一条孤立公式,它来自同样的“独立求和—中心化—标准化”结构。
一分钟内至少 45 次到达
假设某分钟内的到达数确实可建模为 Q ∼ Pois ( 36 ) Q\sim\operatorname{Pois}(36) Q ∼ Pois ( 36 ) 。它的标准差为 6 6 6 。事件 Q ≥ 45 Q\ge45 Q ≥ 45 校正为连续门槛 44.5 44.5 44.5 ,得到
P ( Q ≥ 45 ) ≈ 1 − Φ ( 44.5 − 36 6 ) = 1 − Φ ( 1.4167 ) ≈ 0.0783. P(Q\ge45)
\approx1-\Phi\left(\frac{44.5-36}{6}\right)
=1-\Phi(1.4167)
\approx0.0783. P ( Q ≥ 45 ) ≈ 1 − Φ ( 6 44.5 − 36 )
保留“近似”很必要。泊松分布偏度为 1 / λ 1/\sqrt\lambda 1/ λ ,这里仍有右偏;直接用泊松概率公式计算,会得到约 0.0819 0.0819 0.0819 。正态近似抓住了大致量级,但没有把偏斜完全抹平。
当 λ \lambda λ 很小时,正态模型甚至会给负计数区域分配明显概率,而真实泊松变量只能非负。这是需要回到离散分布的信号。即使 λ \lambda λ 较大,也不意味着极端尾部相对误差很小;如果目标事件很罕见,应直接核算泊松尾概率或使用更适合尾部的方法。
最后别忘了检查泊松模型本身。到达强度若随着时段明显变化,或者许多到达由同一个事件触发,“均值等于方差”的假设就可能不合适。正态近似再准确,也只是在近似那个已经选定的泊松模型。
多大才算大:近似速度与真正的反例
经常有人把中心极限定理缩成一句“样本量超过 30 就正态了”。这句话省掉的,恰好是使用中最需要判断的部分。不同分布的尾部和偏斜差别很大,而且中心附近概率与极端尾概率对误差的要求也不同,没有一个对所有有限方差分布都适用的小样本门槛。
三阶绝对矩给出一条误差界
在 iid、有限正方差之外,再假设
ρ = E ∣ X 1 − μ ∣ 3 < ∞ . \rho=E|X_1-\mu|^3<\infty. ρ = E ∣ X 1 − μ ∣ 3 < ∞.
则存在与分布及 n n n 无关的常数 C C C ,使
sup x ∈ R ∣ P ( Z n ≤ x ) − Φ ( x ) ∣ ≤ C ρ σ 3 n . \sup_{x\in\mathbb R}
\left|P(Z_n\le x)-\Phi(x)\right|
\le\frac{C\rho}{\sigma^3\sqrt n}. x ∈ R sup ∣ P ( Z n ≤ x ) − Φ ( x )
这是 Berry–Esseen 型误差界。我们用它理解数量关系,不追求最优常数。ρ / σ 3 \rho/\sigma^3 ρ / σ 3 是没有单位的量,比较的是三阶绝对偏差相对于方差尺度有多大。它不等于有正负抵消的偏度;一个对称重尾分布偏度可以为零,三阶绝对矩却仍然很大,甚至无限。
这条界控制分布函数的绝对误差。对区间概率,由两个端点的分布函数相减,误差可用两倍右端控制。可是如果真实尾概率只有百万分之一,哪怕绝对误差上界是千分之一,对那个尾概率仍然没有足够精度。不能把一个绝对误差很小的结论,直接读成“每个罕见事件的相对误差都小”。
有限二阶矩已经足够 CLT 成立,三阶绝对矩有限是这里得到明确 1 / n 1/\sqrt n 1/ n 速率的附加条件。不要为了估计速度,反过来把更强条件写成基本定理必需的条件。
有限方差也可能很慢
考虑 X ∼ Bernoulli ( 10 − 6 ) X\sim\operatorname{Bernoulli}(10^{-6}) X ∼ Bernoulli ( 1 0 − 6 ) 。它当然有有限正方差,也满足 iid CLT 的单次分布条件。但在 n = 1000 n=1000 n = 1000 时,完全没有成功的概率是
P ( S 1000 = 0 ) = ( 1 − 10 − 6 ) 1000 ≈ 0.9990005. P(S_{1000}=0)=(1-10^{-6})^{1000}\approx0.9990005. P ( S 1000 = 0 ) = ( 1 − 1 0 − 6 )
也就是说,超过 99.9 % 99.9\% 99.9% 的概率堆在同一个点上。这样的分布不能仅凭“有一千个变量相加”就说已经接近钟形。固定成功概率后继续让 n n n 增大,CLT 最终仍成立;问题是“一千”相对于百万分之一的稀有程度,还远远不大。
重尾:大数成立,正态尺度却可能失效
若独立同分布的 X i X_i X i 具有帕累托尾部
P ( X i > x ) = x − α , x ≥ 1 , 1 < α < 2 , P(X_i>x)=x^{-\alpha},\qquad x\ge1,
\qquad 1<\alpha<2, P ( X i > x ) = x − α , x ≥ 1 ,
则期望 α / ( α − 1 ) \alpha/(\alpha-1) α / ( α − 1 ) 有限,方差却无限。强大数定律仍可保证平均值趋近期望,但本章分母中的 σ \sigma σ 已不存在。稳定平均与有限方差正态波动,因而是两个层次的结论。
更直接的例子是标准柯西分布。它的特征函数为 e − ∣ t ∣ e^{-|t|} e − ∣ t ∣ ,独立同分布时
φ X ˉ n ( t ) = ( e − ∣ t ∣ / n ) n = e − ∣ t ∣ . \varphi_{\bar X_n}(t)
=\left(e^{-|t|/n}\right)^n=e^{-|t|}. φ X ˉ n ( t ) = (
所以无论平均多少次,平均值仍是同一个标准柯西分布。它既不变得越来越集中,也不趋向正态;这里连有限期望条件也没有满足。说“任何分布加起来都会正态”,会直接撞上这个反例。
依赖:多记几份同一个结果不增加信息
令 Y Y Y 等概率取 − 1 -1 − 1 与 1 1 1 ,然后设每一个 X i = Y X_i=Y X i = Y 。各个 X i X_i X 都有均值 、方差 ,而且同分布;但它们完全依赖。此时
S n = n Y , X ˉ n = Y , Var ( S n ) = n 2 . S_n=nY,\qquad \bar X_n=Y,
\qquad \operatorname{Var}(S_n)=n^2. S n = nY , X ˉ n =
若误套独立情形的分母,得到 S n / n = n Y S_n/\sqrt n=\sqrt nY S n / n = n ,概率质量反而向两端跑开。若用实际标准差 标准化,结果始终是两点变量 ,也不会成为正态。
实际模型中的共同天气、共同设备故障、同一批次偏移,都是要检查的依赖来源。较弱的依赖在附加条件下可以有其他 CLT,但方差尺度通常需要计入协方差,不能自动沿用 σ / n \sigma/\sqrt n σ / n 。
不同分布相加时,不能让某一项控制全场
同分布不是所有 CLT 的必要要求,不过去掉它以后需要另作检查。设独立变量 X i X_i X i 的均值为 μ i \mu_i μ i ,令
s n 2 = ∑ i = 1 n Var ( X i ) > 0. s_n^2=\sum_{i=1}^n\operatorname{Var}(X_i)>0. s n 2 = i = 1 ∑ n Var ( X
一种足以得到标准正态极限的条件是:对每个 ε > 0 \varepsilon>0 ε > 0 ,
1 s n 2 ∑ i = 1 n E [ ( X i − μ i ) 2 1 { ∣ X i − μ i ∣ > ε s n } ] ⟶ 0. \frac1{s_n^2}\sum_{i=1}^n
E\left[(X_i-\mu_i)^2
\mathbf1_{\{|X_i-\mu_i|>\varepsilon s_n\}}\right]
\longrightarrow0. s n 2 1
这就是林德伯格条件的一种写法。它要求:超过总标准差某个固定比例的大跳跃,对总方差的贡献最终可以忽略。在这个条件下,( ∑ X i − ∑ μ i ) / s n → d N ( 0 , 1 ) (\sum X_i-\sum\mu_i)/s_n\xrightarrow{d}N(0,1) ( ∑ X i − ∑ μ i ) / s n 。它给“许多小贡献”中的“小”提供了数学含义。
例如,每一行包含 n n n 个相互独立的贡献:一个等概率取 ± n \pm\sqrt n ± n ,另外 n − 1 n-1 n − 1 个都等于零。变量数量越来越多,但总和除以总标准差仍只取 ± 1 \pm1 ± 1 。独立并不意味着每个贡献足够小,数一数项数也不能代替检查方差来源。
这也是解释现实钟形数据时应保持的准确程度。测量误差若能写成许多满足相应条件的小误差之和,正态模型就有理由;人的身高、考试成绩是否适用,还要核对加法结构、群体组成与依赖关系。单凭“影响因素很多”不能直接证明它们正态。
蒙特卡洛:用定理给模拟结果配上误差尺度
前面把概率当作模型给出的量来计算,现在反过来:如果一个概率或期望太难直接算,能不能通过模拟估计它?
假设目标是 θ = E ( Y ) \theta=E(Y) θ = E ( Y ) 。独立生成 Y 1 , … , Y m Y_1,\ldots,Y_m Y 1 , … , Y m ,用
θ ^ m = 1 m ∑ i = 1 m Y i \hat\theta_m=\frac1m\sum_{i=1}^mY_i θ ^ m = m 1 i =
估计 θ \theta θ 。当 E ∣ Y ∣ < ∞ E|Y|<\infty E ∣ Y ∣ < ∞ 时,大数定律说明它会稳定到目标;如果再有 0 < τ 2 = Var ( Y ) < ∞ 0<\tau^2=\operatorname{Var}(Y)<\infty 0 < τ 2 = Var ( Y ) < ,CLT 就进一步给出
θ ^ m − θ τ / m → d N ( 0 , 1 ) . \frac{\hat\theta_m-\theta}{\tau/\sqrt m}\xrightarrow{d}N(0,1). τ / m θ
因此,估计量的标准误差是 τ / m \tau/\sqrt m τ / m 。这里的标准误差是“整个模拟平均值在重新运行时的标准差”,与单次输出 Y Y Y 的标准差 τ \tau τ 不同。
未知方差为什么可以用样本方差替换
通常 τ \tau τ 也未知,可以计算
s m 2 = 1 m − 1 ∑ i = 1 m ( Y i − θ ^ m ) 2 . s_m^2=\frac1{m-1}\sum_{i=1}^m(Y_i-\hat\theta_m)^2. s m 2 = m − 1 1
把它改写成
s m 2 = m m − 1 ( 1 m ∑ i = 1 m Y i 2 − θ ^ m 2 ) . s_m^2=\frac m{m-1}
\left(\frac1m\sum_{i=1}^mY_i^2-\hat\theta_m^2\right). s m 2 = m − 1 m (
由于 E ( Y 2 ) < ∞ E(Y^2)<\infty E ( Y 2 ) < ∞ ,大数定律同时适用于 Y i Y_i Y i 与 Y i 2 Y_i^2 Y i 。所以括号内趋于 ,前面的系数趋于 ,得到 。这一步不需要四阶矩有限。
再把标准化误差写成
θ ^ m − θ s m / m = θ ^ m − θ τ / m ⋅ τ s m . \frac{\hat\theta_m-\theta}{s_m/\sqrt m}
=\frac{\hat\theta_m-\theta}{\tau/\sqrt m}\cdot\frac\tau{s_m}. s m / m
第一项依分布趋于标准正态,第二项依概率趋于 1 1 1 ,两者相乘仍有相同极限。因此大样本时,用 s m / m s_m/\sqrt m s m / m 估计标准误差有数学依据,并非“未知就随便换成样本值”。
由此得到常用的近似区间
θ ^ m ± 1.96 s m m . \hat\theta_m\pm1.96\frac{s_m}{\sqrt m}. θ ^ m ± 1.96 m
这里约 95 % 95\% 95% 的含义是:若按固定的模拟次数反复独立运行整套程序,大约 95 % 95\% 95% 的区间覆盖固定目标 θ \theta θ 。它不是说单次输出有 95 % 95\% 95% 落入该区间,也不是对已经观察到的固定区间作未经说明的参数随机化解释。
若原观测恰好正态,使用样本标准差后的统计量在有限样本下有精确的 t m − 1 t_{m-1} t m − 1 分布;一般非正态模拟输出则没有这个精确结论,当前使用的是大样本正态近似。
用一个单位方形算概率
独立生成 U , V ∼ U ( 0 , 1 ) U,V\sim U(0,1) U , V ∼ U ( 0 , 1 ) ,我们要估计 P ( U + V > 1.2 ) P(U+V>1.2) P ( U + V > 1.2 ) 。把一次输出定义成指示变量
Y = 1 { U + V > 1.2 } . Y=\mathbf1_{\{U+V>1.2\}}. Y = 1 { U + V > 1.2 } .
这就把概率问题改成 E ( Y ) E(Y) E ( Y ) 。由单位方形中的面积计算,右上角满足条件的三角形两直角边都长 0.8 0.8 0.8 ,所以理论值是 θ = 0.8 2 / 2 = 0.32 \theta=0.8^2/2=0.32 θ = 0. 8 2 /2 = 0.32 。于是 τ 2 = 0.32 × 0.68 = 0.2176 \tau^2=0.32\times0.68=0.2176 τ 。
如果模拟 m = 10 000 m=10\,000 m = 10 000 次,理论标准误差为
0.2176 10 000 ≈ 0.004665. \sqrt{\frac{0.2176}{10\,000}}\approx0.004665. 10 000 0.2176 ≈ 0.004665.
近似 95 % 95\% 95% 区间半宽约为 0.00914 0.00914 0.00914 ,即概率尺度上约 0.91 0.91 0.91 个百分点。为了将半宽减半,需要把次数增加到约 40 000 40\,000 40 000 ;多算一倍只能使标准误差乘以 1 / 2 1/\sqrt2 1/ 2 。
更一般地,估计概率 p p p 时,单次指示变量的方差为 p ( 1 − p ) ≤ 1 / 4 p(1-p)\le1/4 p ( 1 − p ) ≤ 1/4 ,所以标准误差不超过 1 / ( 2 m ) 1/(2\sqrt m) 1/ ( 2 m 。但若 极小,关注的通常是相对精度:相对标准误差约为 。只做少量模拟、一次事件都没出现时,代入样本比例得到零标准误差,不能解释成“事件不可能”。
在实验室中选择 P ( U + V > 1.2 ) P(U+V>1.2) P ( U + V > 1.2 ) ,先固定随机种子,比较 m = 1000 m=1000 m = 1000 与 m = 4000 m=4000 m = 4000 时的最终标准误差;再改变种子,观察最终估计的随机差异。模拟使用伪随机数,固定种子便于复现,理论分析则按独立均匀抽样的模型理解。
图上的每一对上下界都是按当时样本数计算的近似区间,不能理解为“整条路径有 95 % 95\% 95% 的概率始终把真值夹住”。特别是起始的一个观测没有可估计的样本方差,界面在该点画出的零宽度只是程序起始值,没有置信区间意义。我们比较的是预先选定的足够大 m m m 处的终点读数,而不是不断观察到满意时才停止后仍宣称同样的覆盖率。
模拟很稳定,也可能稳定在错误目标上
增加 m m m 只减少模拟误差,不会替我们改模型。比如程序把一天内到达强度当成常数,真实系统却有明显高峰;把服务时间视为相互独立,真实系统却在共同故障时一起延长。模拟越多,只会越准确地计算那个简化模型的期望。
因此,报告一个模拟结果时应同时交代一次输出如何生成、目标量是什么、独立重复次数是多少、标准误差多大。若输出来自一条相关的随机过程轨迹,就不能把轨迹长度直接当成独立模拟次数;需要针对依赖性重新评估误差。
把整套推理放回一个总量问题
考虑一个简化的年度赔付模型:有 500 500 500 份相似保单,单份赔付额 X X X 的期望为 120 120 120 元,标准差为 600 600 600 元。先假设各份保单的赔付独立同分布,我们想估计总赔付超过 80 000 80\,000 80 000 元的概率。
从随机变量的定义开始:X i X_i X i 表示第 i i i 份保单这一年的实际赔付,总额为 S 500 = ∑ X i S_{500}=\sum X_i S 500 = ∑ X 。期望为
E ( S 500 ) = 500 × 120 = 60 000. E(S_{500})=500\times120=60\,000. E ( S 500 ) = 500 × 120 = 60 000.
独立性给出方差相加,因此
SD ( S 500 ) = 600 500 ≈ 13 416.4. \operatorname{SD}(S_{500})=600\sqrt{500}\approx13\,416.4. SD ( S 500 ) = 600 500 ≈ 13
在正态近似足够好的前提下,
P ( S 500 > 80 000 ) ≈ 1 − Φ ( 80 000 − 60 000 600 500 ) ≈ 1 − Φ ( 1.4907 ) ≈ 0.0680. P(S_{500}>80\,000)
\approx1-\Phi\left(\frac{80\,000-60\,000}{600\sqrt{500}}\right)
\approx1-\Phi(1.4907)
\approx0.0680. P ( S 500 > 80 000 ) ≈ 1 − Φ (
这个结果约为 6.8 % 6.8\% 6.8% ,但计算还没有结束。题目只给出前两阶矩,并没有保证 500 500 500 份时近似误差足够小。若绝大多数赔付为零、极少数非常大,就要核对尾部;若同一场灾害同时影响许多保单,就要核对依赖。不能仅因为算出了一个漂亮的小数,就把这些问题视为已解决。
例如,若各份赔付方差仍为 σ 2 \sigma^2 σ 2 ,且任意不同两份的相关系数均为 r r r ,则
Var ( S n ) = n σ 2 + n ( n − 1 ) r σ 2 = n σ 2 [ 1 + ( n − 1 ) r ] . \operatorname{Var}(S_n)
=n\sigma^2+n(n-1)r\sigma^2
=n\sigma^2[1+(n-1)r]. Var ( S n ) = n σ 2 + n ( n −
即使 r = 0.01 r=0.01 r = 0.01 ,在 n = 500 n=500 n = 500 时方差也会是独立情形的 5.99 5.99 5.99 倍,标准差约为原来的 2.45 2.45 2.45 倍。这说明“小相关”在大组合里未必影响小。我们只是在比较方差,不能仅凭这个修正后的方差就断言总额仍近似正态;分布近似还要由相应依赖模型支持。
从定义变量到计算矩,从联合关系到选择极限定理,再回到事件解释,这才是一条完整的建模过程。它与本课程前面学过的样本空间、随机变量、分布和条件结构,其实是同一套语言的连续使用。
练习:把条件、尺度和事件一起写出来
平均值稳定了,标准化误差也趋于零吗
设 X i X_i X i iid,均值为 μ \mu μ 、方差为 0 < σ 2 < ∞ 0<\sigma^2<\infty 0 < σ 2 < ∞ 。判断:因为 X ˉ n → ,所以 。再说明单个 的分布是否随 变得正态。
显示答案 第一个推断错误。依概率趋于零的误差乘上发散的 n \sqrt n n ,不必仍趋于零。中心极限定理给出的正是非退化极限 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) ;若它依概率趋于零,又会依分布趋于常数零,与这个极限矛盾。单个 X 1 X_1 X 的分布则从头到尾固定,CLT 改变的是标准化和的分布。
一百个零件的平均长度
独立同分布的零件长度均值为 20 20 20 毫米,标准差为 0.4 0.4 0.4 毫米。近似计算 100 100 100 个零件平均长度超过 20.06 20.06 20.06 毫米的概率,并说清哪一步是近似。
显示答案 均值的标准差精确等于 0.4 / 100 = 0.04 0.4/\sqrt{100}=0.04 0.4/ 100 = 0.04 毫米,目标事件精确等价于标准化均值超过 ( 20.06 − 20 ) / 0.04 = 1.5 (20.06-20)/0.04=1.5 ( 20.06 − 20 ) /0.04 = 1.5 。把这个标准化均值换成标准正态才是近似,得到
少于 16 次成功与不超过 15 次成功
设 B ∼ Bin ( 250 , 0.08 ) B\sim\operatorname{Bin}(250,0.08) B ∼ Bin ( 250 , 0.08 ) 。分别把 B < 16 B<16 B < 16 与 B ≤ 15 B\le15 B ≤ 15 改写成连续性校正后的事件,再近似计算其概率。
显示答案 这两个离散事件完全相同,都包含 0 0 0 到 15 15 15 。因此两者都使用正态门槛 15.5 15.5 15.5 ,不能因为一个写“少于”就移动成 16.5 16.5 16.5 。
μ = 20 , σ = 250 × 0.08 × 0.92 = 18.4 , \mu=20,\qquad \sigma=\sqrt{250\times0.08\times0.92}=\sqrt{18.4}, μ = 20 , σ =
一个泊松区间
设 Q ∼ Pois ( 64 ) Q\sim\operatorname{Pois}(64) Q ∼ Pois ( 64 ) 。用正态近似计算 P ( 55 ≤ Q ≤ 75 ) P(55\le Q\le75) P ( 55 ≤ Q ≤ 75 ) 。如果有人写 Φ ( 75 ) − Φ ( 55 ) \Phi(75)-\Phi(55) Φ ( 75 ) − Φ ( 55 ,他遗漏了什么?
显示答案 近似正态变量的均值为 64 64 64 、标准差为 8 8 8 。先把整数区间改成 [ 54.5 , 75.5 ] [54.5,75.5] [ 54.5 , 75.5 ] ,再标准化:
P ( 55 ≤ Q ≤ 75 ) ≈ Φ ( 75.5 − 64 8 ) − Φ ( 54.5 − 64 8 ) = Φ ( 1.4375 ) − Φ ( − 1.1875 ) ≈ 0.8072. P(55\le Q\le75)
\approx\Phi\left(\frac{75.5-64}{8}\right)
-\Phi\left(\frac{54.5-64}{8}\right)
=\Phi(1.4375)-\Phi(-1.1875)
\approx0.8072. P ( 55 ≤
由一次模拟报告规划下一次
一次独立重复模拟做了 10 000 10\,000 10 000 次,样本均值为 2.37 2.37 2.37 ,样本标准差为 5.8 5.8 5.8 。估计标准误差与近似 95 % 95\% 95% 区间。若希望区间半宽减半,大约需要多少次?
显示答案 标准误差估计为 5.8 / 100 = 0.058 5.8/100=0.058 5.8/100 = 0.058 ,使用 1.96 1.96 1.96 倍标准误差,区间为
2.37 ± 1.96 × 0.058 = 2.37 ± 0.11368 , 2.37\pm1.96\times0.058
=2.37\pm0.11368, 2.37 ± 1.96 × 0.058 = 2.37 ± 0.11368 , 即约 [ 2.2563 , 2.4837 ] [2.2563,2.4837] 。若输出方差保持不变,半宽按 缩放,需要约 次。这个区间依赖有限方差、独立重复和足够好的大样本近似,不包括模型设置错误产生的偏差。
总工时与共同变慢
仓库一天处理 900 900 900 个订单,每个订单所需工时均值 4.2 4.2 4.2 分钟、标准差 3 3 3 分钟。先按独立同分布模型估计总工时超过 3900 3900 3900 分钟的概率。再解释:若同一天的网络拥堵让所有订单一起变慢,原计算哪一步需要重做?
显示答案 总工时期望为 900 × 4.2 = 3780 900\times4.2=3780 900 × 4.2 = 3780 分钟,独立模型下标准差为 3 900 = 90 3\sqrt{900}=90 3 900 = 90 分钟。于是
P (
从“平均会稳定”走到“误差可以计算”
回想课程最开始,样本空间装着一次实验可能出现的结果;随机变量是一条把结果映射成数的确定规则。分布把取值与概率组织起来,期望按概率加权给出中心,方差描述离中心的波动。联合分布与条件概率提醒我们:单个变量各自怎样分布,还没有说完它们如何一起出现。
到随机变量的和,我们开始研究许多次观测共同形成的量。上一章的大数定律说明,满足条件的平均值会稳定到期望。现在的中心极限定理进一步说明,在有限正方差的 iid 模型里,平均误差的自然尺度是 σ / n \sigma/\sqrt n σ / n ,按这个尺度放大后,分布趋向标准正态。
导论课里那句“频率可以估计概率”,到这里已经有了两层更具体的解释:大数定律说明估计为什么趋于正确目标,中心极限定理帮助我们估计有限次数下的随机误差。它们都没有替我们保证模型正确,也没有要求每条路径的误差逐次减小。
以后进入统计推断,你会把样本均值及其标准误差组合成区间和检验;进入随机过程,你会重新处理随时间产生的依赖;做模拟时,你会区分单次输出的波动与模拟平均值的误差。继续往前时,可以始终保留本章这一习惯:先问研究的是哪个随机量、有哪些联合条件,再写它的中心、尺度和目标事件。公式因此有了可以核对的对象,近似也有了明确的适用范围。