自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

数理统计 I

  1. 01统计模型:把问题变成可检验的假设
  2. 02抽样分布:正态、卡方、t 与 F
  3. 03估计量的评价:偏差、方差与一致性
  4. 04矩估计:用样本特征解出参数
  5. 05最大似然:让已观察的数据得到合理解释
  6. 06充分统计量:压缩数据而不丢参数信息
  7. 07信息与最优性:估计精度的界限
  8. 08大样本推断:从极限到标准误
  9. 09置信区间:构造并解释覆盖保证
  10. 10检验原理:错误率、功效与最强检验
  11. 11似然比、Wald 与得分:三条检验路径
  12. 12综合推断:正态线性模型与可复核报告
正在加载课程章节内容
课程数学数理统计 I大样本推断:从极限到标准误

极限定理给出的近似,需要落实到主导误差与余项的比较。Delta 方法和 MLE 的正态极限都依赖这一步,导数退化或模型设错时尤其要检查。

1. 变换估计值时的误差传播

平均等待时间估为 4 秒,标准误是 0.4 秒。取倒数得到每秒 0.25,标准误却不能照着取倒数,它的变化由局部斜率决定。平方函数在零点又会出现不同情况:斜率为零,波动仍然存在。局部展开能够说明这些差别,也指出大样本近似在哪一步发挥作用。

在 iid 样本满足 E(X)=μE(X)=\muE(X)=μ、0<Var⁡(X)=σ2<∞0<\operatorname{Var}(X)=\sigma^2<\infty0<Var(X)=σ2<∞ 时,大数定律与中心极限定理分别给出

Xˉ→Pμ,n(Xˉ−μ)→dN(0,σ2).\bar X\xrightarrow{P}\mu,\qquad \sqrt n(\bar X-\mu)\xrightarrow{d}N(0,\sigma^2).XˉP​μ,n​(Xˉ−μ)d​N(0,σ2).

第一式说误差会消失;第二式则把缩小的误差放大 n\sqrt nn​ 倍,留下一个不退化的极限形状。因此写成 Xˉ≈N(μ,σ2/n)\bar X\approx N(\mu,\sigma^2/n)Xˉ≈N(μ,σ2/n) 时,是把这个极限用于有限样本的近似,不能当作普遍的精确等式。

三个极限工具的分工
图 8-1:三个极限工具的分工

设 An→dAA_n\xrightarrow d AAn​d​A,Bn→PbB_n\xrightarrow P bBn​P​b,其中 bbb 是常数。Slutsky 定理允许把二者作和、积;若 b≠0b\ne0b=0 还可以作比。它不要求每个 nnn 下二者独立。这个工具解释了为何能把未知尺度替换成一致估计。

放大误差后观察极限形状

只看 Xˉ\bar XXˉ 本身,随着 nnn 增大,它会越来越靠近 μ\muμ,极限只剩一个点。乘以 n\sqrt nn​ 相当于调高放大倍数,让正在缩小的误差仍然可见。中心极限定理描述的正是这个形状。

因此,均值趋于常数和标准化误差趋于正态,可以同时成立,它们看的尺度不同。也别顺口说成“原始数据越来越正态”:指数观测仍然右偏,接近正态的是许多独立观测的标准化平均。

伯努利 p=0.01,n=100p=0.01,n=100p=0.01,n=100 提供一个边界检查:P(S=0)=0.99100≈0.366P(S=0)=0.99^{100}\approx0.366P(S=0)=0.99100≈0.366,标准化均值约有 36.6% 的概率停在同一个最左端点。这显然不能仅凭 n>30n>30n>30 就当成平滑正态曲线。样本量要与分布形状、稀有程度及所需尾部精度一起判断。

2. 标准误是估计规则的波动尺度

标准误描述估计量抽样分布的标准差,也可以指它的估计。拿均值来说,样本标准差 SSS 看个体之间散得多开, S/nS/\sqrt nS/n​ 才估计平均值的标准误。单位一样,用途不同,代公式前先分清。

若 S→Pσ>0S\xrightarrow P\sigma>0SP​σ>0,则

n(Xˉ−μ)S→dN(0,1).\frac{\sqrt n(\bar X-\mu)}S\xrightarrow d N(0,1).Sn​(Xˉ−μ)​d​N(0,1).

这次用的是大样本正态极限。如果总体正态,同一个比值在有限样本下精确服从 tn−1t_{n-1}tn−1​;一般总体只有相同的分式,还不能叫它精确 t。

相关观测往往不能使用标准误 S/nS/\sqrt nS/n​。这类数据也可能满足大数定律和中心极限定理,但需要相应的长期方差或结构模型。直方图平滑并不能验证这些条件。

3. 余项相对于主项的量级

Taylor 展开的余项是否可以忽略,取决于它与主项的相对大小。删掉一项若改变了极限,近似就没有依据。下面的随机阶记号用来完成这种比较。

写 Rn=oP(an)R_n=o_P(a_n)Rn​=oP​(an​),表示 Rn/an→P0R_n/a_n\to_P0Rn​/an​→P​0。例如 Rn=Z/nR_n=Z/nRn​=Z/n,其中 Z∼N(0,1)Z\sim N(0,1)Z∼N(0,1),则 Rn=oP(n−1/2)R_n=o_P(n^{-1/2})Rn​=oP​(n−1/2),因为 Rn/n−1/2=Z/n→P0R_n/n^{-1/2}=Z/\sqrt n\to_P0Rn​/n−1/2=Z/n​→P​0。这里不是说每个样本中的余项都小于某个固定数,而是说超过任意给定相对误差的概率会消失。

写 Rn=OP(an)R_n=O_P(a_n)Rn​=OP​(an​),表示 Rn/anR_n/a_nRn​/an​ 在概率上有界:对任意小的 ε>0\varepsilon>0ε>0,可以找到有限的 MMM,使足够大的 nnn 满足 P(∣Rn∣>Man)<εP(|R_n|>Ma_n)<\varepsilonP(∣Rn​∣>Man​)<ε。例如 Z/n=OP(n−1/2)Z/\sqrt n=O_P(n^{-1/2})Z/n​=OP​(n−1/2),却不是 oP(n−1/2)o_P(n^{-1/2})oP​(n−1/2),因为除以该尺度后仍然是非退化的 ZZZ。

趋零因子与概率有界因子的乘积

若 An=OP(1)A_n=O_P(1)An​=OP​(1)、Bn=oP(1)B_n=o_P(1)Bn​=oP​(1),则 AnBn=oP(1)A_nB_n=o_P(1)An​Bn​=oP​(1)。证明只需把可能出问题的地方分成两块。对任意 δ>0\delta>0δ>0 与 M>0M>0M>0,

P(∣AnBn∣>δ)≤P(∣An∣>M)+P(∣Bn∣>δ/M).P(|A_nB_n|>\delta) \le P(|A_n|>M)+P(|B_n|>\delta/M).P(∣An​Bn​∣>δ)≤P(∣An​∣>M)+P(∣Bn​∣>δ/M).

MMM 需要选得足够大以压小第一项;固定这个值后,增加 nnn 能使第二项变小。这一顺序保证了总概率可任意小,既不要求 AnA_nAn​ 收敛,也不依赖两项独立。若将 AnA_nAn​ 换成确定数 nnn,它已不是 OP(1)O_P(1)OP​(1);虽然 Bn=1/n→0B_n=1/n\to0Bn​=1/n→0,乘积却恒等于 1。

有 n(Tn−θ)→dN(0,v)\sqrt n(T_n-\theta)\to_dN(0,v)n​(Tn​−θ)→d​N(0,v) 时,放大后的误差在概率上有界,所以 Tn−θ=OP(n−1/2)T_n-\theta=O_P(n^{-1/2})Tn​−θ=OP​(n−1/2)。若 g′′g''g′′ 在真值附近有界,二阶余项至多为常数乘 (Tn−θ)2(T_n-\theta)^2(Tn​−θ)2,即 OP(n−1)O_P(n^{-1})OP​(n−1)。乘上最终尺度 n\sqrt nn​ 后,它变为 OP(n−1/2)=oP(1)O_P(n^{-1/2})=o_P(1)OP​(n−1/2)=oP​(1),因此不会改变一阶极限。

4. Delta 方法:用切线传递误差

设 n(Tn−θ)→dN(0,v)\sqrt n(T_n-\theta)\to_dN(0,v)n​(Tn​−θ)→d​N(0,v),函数 ggg 在 θ\thetaθ 处可微。由可微的定义,可以写成

g(θ+h)=g(θ)+g′(θ)h+h r(h),r(h)→0 (h→0).g(\theta+h)=g(\theta)+g'(\theta)h+h\,r(h),\qquad r(h)\to0\ (h\to0).g(θ+h)=g(θ)+g′(θ)h+hr(h),r(h)→0 (h→0).

在 h=0h=0h=0 处补定义 r(0)=0r(0)=0r(0)=0。用随机误差 h=Tn−θh=T_n-\thetah=Tn​−θ 代入,并乘 n\sqrt nn​:

n[g(Tn)−g(θ)]=g′(θ)n(Tn−θ)+n(Tn−θ)r(Tn−θ).\sqrt n[g(T_n)-g(\theta)] =g'(\theta)\sqrt n(T_n-\theta) +\sqrt n(T_n-\theta)r(T_n-\theta).n​[g(Tn​)−g(θ)]=g′(θ)n​(Tn​−θ)+n​(Tn​−θ)r(Tn​−θ).

第一项有已知的正态极限;一致性使 r(Tn−θ)→P0r(T_n-\theta)\to_P0r(Tn​−θ)→P​0,上一节的乘积论证使第二项趋零。于是

n[g(Tn)−g(θ)]→dN ⁣(0,[g′(θ)]2v).\sqrt n[g(T_n)-g(\theta)]\to_d N\!\left(0,[g'(\theta)]^2v\right).n​[g(Tn​)−g(θ)]→d​N(0,[g′(θ)]2v).

证明只要求真值处可微。二阶导数有界,确实方便检查余项,但它是充分条件,不能反过来当作唯一条件。还有一种情形: g′(θ)=0g'(\theta)=0g′(θ)=0 时,一阶极限仍成立,只是退化在零点。下一阶波动还没被它描述出来。

Delta 方法是一把局部尺
图 8-2:Delta 方法是一把局部尺

实际计算常用 SE⁡^(g(Tn))≈∣g′(Tn)∣SE⁡^(Tn)\widehat{\operatorname{SE}}(g(T_n))\approx|g'(T_n)|\widehat{\operatorname{SE}}(T_n)SE(g(Tn​))≈∣g′(Tn​)∣SE(Tn​)。导数的绝对值保证标准误非负,其参数化必须与输入一致,单位也需同步核对。

5. 正参数例:对数与速率变换

假设平均等待时间的估计为 μ^=4\hat\mu=4μ^​=4 秒,估计标准误为 0.40.40.4 秒。对数变换 g(μ)=log⁡μg(\mu)=\log\mug(μ)=logμ 的导数为 1/μ1/\mu1/μ,所以对数尺度标准误约为 0.4/4=0.10.4/4=0.10.4/4=0.1。这把绝对误差转换为相对尺度上的误差。

严格处理单位时,应对无量纲比值取对数,例如 log⁡(μ/1秒)\log(\mu/1\text{秒})log(μ/1秒);选择不同基准只改变对数位置,不改变这里的标准误。区间若在对数尺度构造后取指数,会保持正值,但覆盖保证仍取决于所用近似。

对数变换与相对误差
图 8-3:对数变换与相对误差

换成指数速率 λ=1/μ\lambda=1/\muλ=1/μ,导数为 −1/μ2-1/\mu^2−1/μ2,标准误约为 0.4/16=0.0250.4/16=0.0250.4/16=0.025 每秒。你可以看到,这一步用导数传播误差,并没有把原标准误也取倒数。

另一例。 伯努利样本比例估计 p2p^2p2,令 g(p)=p2g(p)=p^2g(p)=p2。当真值在内部且非零时,

SE⁡(p^2)≈2pp(1−p)n.\operatorname{SE}(\hat p^2)\approx 2p\sqrt{\frac{p(1-p)}n}.SE(p^​2)≈2pnp(1−p)​​.

实际可代入 p^\hat pp^​,但小样本或接近边界时要警惕近似失真。

把一份平均时间报告改成速率报告

25 次独立等待的样本均值为 4 秒,样本标准差为 2 秒。暂且假定大样本近似适用,目标改为速率 λ=1/μ\lambda=1/\muλ=1/μ 时,估计值与标准误都需要换算。

2 秒描述个体观测的样本标准差。平均值的估计标准误为 2/25=0.42/\sqrt{25}=0.42/25​=0.4 秒。

估计值取倒数,成为 λ^=1/4=0.25\hat\lambda=1/4=0.25λ^=1/4=0.25 每秒。变换的导数 g′(μ)=−1/μ2g'(\mu)=-1/\mu^2g′(μ)=−1/μ2 在 4 处为 −1/16-1/16−1/16。

局部来看,输入误差乘斜率,标准误乘斜率绝对值,所以输出标准误约为 0.4/16=0.0250.4/16=0.0250.4/16=0.025 每秒。写成 1/0.41/0.41/0.4 就弄反了,把误差尺度也当作中心值去取倒数了。

切线近似的精度可以在附近几个输入值处检查。在 3.63.63.6 和 4.44.44.4 处,真实倒数约为 0.2778、0.2273,切线预测约为 0.275、0.225,已经显示出不对称。如果输入经常接近零,倒数的曲率很强,一阶近似就可能失效。

这次只算了局部标准误,并没有证明 25 个样本一定足够。要拿它作推断,还得看模型、近似条件和尾部校准。Delta 方法给了计算路径,精度仍需要检查。

6. MLE 的一致性

当前数据的似然峰值已在第 5 章求出,一致性还要说明它在样本增加时靠近真值。难处是最大点随数据移动,对每个固定参数单独使用大数定律,并不能控制这个移动位置。

设 ℓn(θ)=∑ilog⁡fθ(Xi)\ell_n(\theta)=\sum_i\log f_\theta(X_i)ℓn​(θ)=∑i​logfθ​(Xi​),记平均目标函数 Mn(θ)=ℓn(θ)/nM_n(\theta)=\ell_n(\theta)/nMn​(θ)=ℓn​(θ)/n。在真分布 fθ0f_{\theta_0}fθ0​​ 下,其总体版本是 M(θ)=Eθ0log⁡fθ(X)M(\theta)=E_{\theta_0}\log f_\theta(X)M(θ)=Eθ0​​logfθ​(X)。若相关期望有限、模型可识别并具有共同支持,Jensen 不等式给出

M(θ)−M(θ0)=Eθ0log⁡fθ(X)fθ0(X)≤log⁡Eθ0fθ(X)fθ0(X)=0.M(\theta)-M(\theta_0) =E_{\theta_0}\log\frac{f_\theta(X)}{f_{\theta_0}(X)} \le\log E_{\theta_0}\frac{f_\theta(X)}{f_{\theta_0}(X)}=0.M(θ)−M(θ0​)=Eθ0​​logfθ0​​(X)fθ​(X)​≤logEθ0​​fθ0​​(X)fθ​(X)​=0.

最后一个期望是对 fθf_\thetafθ​ 的积分,等于 1。对数严格凹,取等要求这个密度比几乎处处为常数;归一化使常数为 1,可识别性再把“分布相同”变成“参数相同”。因此总体目标在真值处有唯一峰值。Jensen 的支撑线解释可回看概率论 I 第 15 章。

唯一峰值与远处候选的正间隙

下面给出一组足以完成证明的条件。对每个 ε>0\varepsilon>0ε>0,假设

Δε=M(θ0)−sup⁡∣θ−θ0∣≥εM(θ)>0,sup⁡θ∈Θ∣Mn(θ)−M(θ)∣→P0.\Delta_\varepsilon=M(\theta_0)- \sup_{|\theta-\theta_0|\ge\varepsilon}M(\theta)>0, \qquad \sup_{\theta\in\Theta}|M_n(\theta)-M(\theta)|\to_P0.Δε​=M(θ0​)−∣θ−θ0​∣≥εsup​M(θ)>0,θ∈Θsup​∣Mn​(θ)−M(θ)∣→P​0.

前一条件要求:离真值至少 ε\varepsilonε 的候选,都在总体目标上落后一个正间隙。后一条件要求样本曲线整段靠近总体曲线。紧参数区间、连续目标和唯一峰值有助于保证前面的间隙,但整段的一致收敛仍要单独验证。

当整段曲线的误差小于 Δε/3\Delta_\varepsilon/3Δε​/3 时,任何区间外候选都有

Mn(θ)≤M(θ0)−2Δε/3,Mn(θ0)>M(θ0)−Δε/3.M_n(\theta)\le M(\theta_0)-2\Delta_\varepsilon/3, \qquad M_n(\theta_0)>M(\theta_0)-\Delta_\varepsilon/3.Mn​(θ)≤M(θ0​)−2Δε​/3,Mn​(θ0​)>M(θ0​)−Δε​/3.

区间外候选都无法超过真值处的目标,样本最大点只能留在 ε\varepsilonε 邻域。一致误差越界的概率趋零,便得到 θ^n→Pθ0\hat\theta_n\to_P\theta_0θ^n​→P​θ0​。对整段曲线的控制排除了随 nnn 移动的尖峰,这正是逐点大数定律未能保证的部分。

具体模型里也可能有更短的证明。指数速率 MLE 是 1/Xˉ1/\bar X1/Xˉ,由 Xˉ→P1/λ0>0\bar X\to_P1/\lambda_0>0Xˉ→P​1/λ0​>0 和倒数连续,直接就能得到一致性。能这样算清楚时,无须再绕道验证整段目标函数。

7. 把 MLE 的正态极限完整推出来

下面证明单参数 MLE 的正态极限。观测要求 iid,真值为内点,选定估计已经证明一致,并以趋于 1 的概率满足得分方程。真值附近的对数密度需二次可微,相关求导与积分能够交换;单次得分方差 I1(θ0)I_1(\theta_0)I1​(θ0​) 应为正且有限。证明还要控制平均二阶导数在真值附近的变化,这项条件稍后会具体核验。

记单次得分 u(x,θ)=∂θlog⁡fθ(x)u(x,\theta)=\partial_\theta\log f_\theta(x)u(x,θ)=∂θ​logfθ​(x)、总得分 Un=∑iu(Xi,θ)U_n=\sum_i u(X_i,\theta)Un​=∑i​u(Xi​,θ)。在可以交换求导和积分时,Eθ0u=0E_{\theta_0}u=0Eθ0​​u=0,且 Eθ0u2=−Eθ0∂θu=I1(θ0)E_{\theta_0}u^2=-E_{\theta_0}\partial_\theta u=I_1(\theta_0)Eθ0​​u2=−Eθ0​​∂θ​u=I1​(θ0​);这些恒等式的证明见第 7 章。

对得分方程用带中间点的中值形式,得到精确等式

0=Un(θ^n)=Un(θ0)+Un′(θ~n)(θ^n−θ0),0=U_n(\hat\theta_n)=U_n(\theta_0) +U_n'(\tilde\theta_n)(\hat\theta_n-\theta_0),0=Un​(θ^n​)=Un​(θ0​)+Un′​(θ~n​)(θ^n​−θ0​),

其中 θ~n\tilde\theta_nθ~n​ 位于两者之间。在分母非零的事件上整理:

n(θ^n−θ0)=Un(θ0)/n−Un′(θ~n)/n.\sqrt n(\hat\theta_n-\theta_0) =\frac{U_n(\theta_0)/\sqrt n}{-U_n'(\tilde\theta_n)/n}.n​(θ^n​−θ0​)=−Un′​(θ~n​)/nUn​(θ0​)/n​​.

分子的各项得分 iid、均值零、方差为 I1I_1I1​。总和除以 n\sqrt nn​ 后,由 CLT 得到 Un(θ0)/n→dN(0,I1)U_n(\theta_0)/\sqrt n\to_dN(0,I_1)Un​(θ0​)/n​→d​N(0,I1​)。此时的极限方差仍是 I1I_1I1​,并非 1/I11/I_11/I1​,曲率分母尚未计入。

分母若固定在真值处,大数定律给出 −Un′(θ0)/n→PI1-U_n'(\theta_0)/n\to_PI_1−Un′​(θ0​)/n→P​I1​。实际计算位置却是随机的 θ~n\tilde\theta_nθ~n​,还需证明这种移动不改变极限。

一种容易检查的条件是:真值某个邻域内存在可积函数 H(X)H(X)H(X),使

∣∂θu(X,t)−∂θu(X,θ0)∣≤H(X)∣t−θ0∣.|\partial_\theta u(X,t)-\partial_\theta u(X,\theta_0)| \le H(X)|t-\theta_0|.∣∂θ​u(X,t)−∂θ​u(X,θ0​)∣≤H(X)∣t−θ0​∣.

于是曲率差的绝对值至多为

∣Un′(θ~n)−Un′(θ0)n∣≤∣θ~n−θ0∣1n∑iH(Xi)→P0.\left|\frac{U_n'(\tilde\theta_n)-U_n'(\theta_0)}n\right| \le |\tilde\theta_n-\theta_0|\frac1n\sum_iH(X_i)\to_P0.​nUn′​(θ~n​)−Un′​(θ0​)​​≤∣θ~n​−θ0​∣n1​i∑​H(Xi​)→P​0.

第一个因子由一致性趋零,第二个由 LLN 稳定在有限数,曲率差才随之消失。这补上了随机中间点与固定真值之间的一步。它是充分条件,某些模型也能直接用代数证明同样的结论。

现在分母趋于严格正的 I1I_1I1​,接近零的概率消失,就能用 Slutsky 把两部分合起来,不需要它们相互独立:

n(θ^n−θ0)→dN ⁣(0,I1(θ0)I1(θ0)2)=N(0,I1(θ0)−1).\sqrt n(\hat\theta_n-\theta_0)\to_d N\!\left(0,\frac{I_1(\theta_0)}{I_1(\theta_0)^2}\right) =N(0,I_1(\theta_0)^{-1}).n​(θ^n​−θ0​)→d​N(0,I1​(θ0​)2I1​(θ0​)​)=N(0,I1​(θ0​)−1).
MLE 的大样本形状
图 8-4:MLE 的大样本形状

逐条件核验:指数速率模型

对 fλ(x)=λe−λxf_\lambda(x)=\lambda e^{-\lambda x}fλ​(x)=λe−λx,x>0,λ>0x>0,\lambda>0x>0,λ>0,有 u=1/λ−xu=1/\lambda-xu=1/λ−x、u′=−1/λ2u'=-1/\lambda^2u′=−1/λ2。由均值 1/λ01/\lambda_01/λ0​ 与方差 1/λ021/\lambda_0^21/λ02​,得分均值为零、方差为 1/λ021/\lambda_0^21/λ02​。支持不随参数移动,真值为正内点,λ^=1/Xˉ\hat\lambda=1/\bar Xλ^=1/Xˉ 已由 LLN 证明一致。

曲率在这里尤其透明:−Un′(λ~)/n=1/λ~2→P1/λ02-U_n'(\tilde\lambda)/n=1/\tilde\lambda^2\to_P1/\lambda_0^2−Un′​(λ~)/n=1/λ~2→P​1/λ02​。若使用上面的控制条件,在 [λ0/2,3λ0/2][\lambda_0/2,3\lambda_0/2][λ0​/2,3λ0​/2] 内,∣u′′∣=2/λ3≤16/λ03|u''|=2/\lambda^3\le16/\lambda_0^3∣u′′∣=2/λ3≤16/λ03​,可取有限常数 HHH。各条件于是都有了具体位置,推出 n(λ^−λ0)→dN(0,λ02)\sqrt n(\hat\lambda-\lambda_0)\to_dN(0,\lambda_0^2)n​(λ^−λ0​)→d​N(0,λ02​),估计标准误为 λ^/n\hat\lambda/\sqrt nλ^/n​。

这里得到的仍是分布极限,不能直接说偏差、方差也收敛到极限分布的矩。那还需要尾部控制或单独计算。指数模型可以用 Gamma 逆矩直接算有限样本偏差,第 4 章已把这条计算写出。

Slutsky 定理中的同源数据

标准化均值可以写成

n(Xˉ−μ)S=n(Xˉ−μ)σ⋅σS.\frac{\sqrt n(\bar X-\mu)}{S} =\frac{\sqrt n(\bar X-\mu)}{\sigma}\cdot\frac{\sigma}{S}.Sn​(Xˉ−μ)​=σn​(Xˉ−μ)​⋅Sσ​.

第一个因子由 CLT 趋于标准正态,第二个因为 S→Pσ>0S\to_P\sigma>0S→P​σ>0 而趋于常数 1。后者的随机波动最终消失,所以 Slutsky 允许把它们相乘,即使每次都用了同一批数据,也不要求它们独立。

对照第 2 章:精确 t 靠的是正态样本均值和方差独立;这里靠的是尺度估计在极限中稳定。分式虽然一样,保证来自两条不同的路线,使用时要说清走的是哪条。

8. 两个估计一起变换,协方差不能丢

向量估计满足 n(Tn−θ)→dN(0,Σ)\sqrt n(\mathbf T_n-\boldsymbol\theta)\to_dN(\mathbf0,\Sigma)n​(Tn​−θ)→d​N(0,Σ) 时,可微标量函数 ggg 的一阶变化为梯度与误差的内积,输出渐近方差是 ∇gTΣ∇g\nabla g^{\mathsf T}\Sigma\nabla g∇gTΣ∇g。证明仍需控制余项,线性组合的方差计算则比单变量多出了协方差项,不能省略。

例如想估计两个平均量的比 ρ=μX/μY\rho=\mu_X/\mu_Yρ=μX​/μY​,μY≠0\mu_Y\ne0μY​=0,每个独立观测单位同时记录 (Xi,Yi)(X_i,Y_i)(Xi​,Yi​)。梯度为 (1/μY,−μX/μY2)(1/\mu_Y,-\mu_X/\mu_Y^2)(1/μY​,−μX​/μY2​),故比值估计的方差近似

1n(σX2μY2+μX2σY2μY4−2μXσXYμY3).\frac1n\left(\frac{\sigma_X^2}{\mu_Y^2} +\frac{\mu_X^2\sigma_Y^2}{\mu_Y^4} -\frac{2\mu_X\sigma_{XY}}{\mu_Y^3}\right).n1​(μY2​σX2​​+μY4​μX2​σY2​​−μY3​2μX​σXY​​).

设 100 个单位给出 xˉ=6,yˉ=3\bar x=6,\bar y=3xˉ=6,yˉ​=3,个体层的方差估计分别为 9、4,协方差估计为 3。比值估计为 2,方差约 (1+16/9−4/3)/100=13/900(1+16/9-4/3)/100=13/900(1+16/9−4/3)/100=13/900,标准误约 0.1202。若误当两个均值独立,便删去了抵消项,标准误会被估成约 0.1667。相关不总是让误差增大,方向取决于变换的梯度;分母接近零时,一阶比值近似也可能失效。

9. 模型设错,点估计稳定也不够

假设仍用指数似然拟合正观测,但真实分布只有均值 μ>0\mu>0μ>0、有限方差 σ2\sigma^2σ2,不一定满足指数分布的 σ2=μ2\sigma^2=\mu^2σ2=μ2。同一个优化仍得到 1/Xˉ1/\bar X1/Xˉ,它一致估计的是 1/μ1/\mu1/μ。这个量可以保留“平均时间倒数”的意义,却不能未经验证就被解释成恒定的瞬时事件速率。

直接由 CLT 和倒数 Delta 方法,

n(1Xˉ−1μ)→dN(0,σ2/μ4).\sqrt n\left(\frac1{\bar X}-\frac1\mu\right) \to_dN(0,\sigma^2/\mu^4).n​(Xˉ1​−μ1​)→d​N(0,σ2/μ4).

因此,更一般的标准误估计为 S/(Xˉ2n)S/(\bar X^2\sqrt n)S/(Xˉ2n​)。只有指数模型正确, SSS 才与 Xˉ\bar XXˉ 趋于同一尺度,化简回 1/(Xˉn)1/(\bar X\sqrt n)1/(Xˉn​)。同一个优化能给出点估计,并不表示模型内的不确定性公式也必然合适。

前面 25 个观测、均值 4、标准差 2 的例子,如果强行套指数信息,会给标准误 0.25/5=0.050.25/5=0.050.25/5=0.05;使用一般均值变换则是 0.025。两者不同来自分布方差的假设不同。这里仅说明原理,不能从一次样本标准差偏小便宣布总体绝不可能是指数分布。

连续变换可以保留一致性,但不退化的一阶正态近似还需要相应导数非零。导数为零时,应寻找主导的高阶项和新尺度;一阶极限退化不等于有限样本完全确定。

10. 一阶导数为零,随机性不会消失

导数为零时的一阶失效
图 8-5:导数为零时的一阶失效

若 g(x)=x2g(x)=x^2g(x)=x2 且真值 θ=0\theta=0θ=0,则 g′(0)=0g'(0)=0g′(0)=0,一阶 Delta 极限退化。但若原观测独立正态、均值为零、方差为 σ2\sigma^2σ2,则

nXˉ2σ2=(nXˉσ)2∼χ12\frac{n\bar X^2}{\sigma^2} =\left(\frac{\sqrt n\bar X}{\sigma}\right)^2\sim\chi^2_1σ2nXˉ2​=(σn​Xˉ​)2∼χ12​

对每个 nnn 都精确成立。平方误差的尺度是 1/n1/n1/n,形状是卡方;报告“标准误为零,所以完全确定”会丢掉主导的二阶项。

实验:水平切线遗漏的二阶波动

μ=0 时,平方函数的切线水平,一阶标准误为零。平方估计量却可能仍有波动,试着用展开中的下一项判断其尺度。

默认设置为 log、μ=2、SE=.1。“观察平方零点”会切换到退化的一阶情形;保持 μ=0 并缩小 SE,可以对照两种情况下分布宽度的变化。

log 默认的一阶标准误是 .05,接近精确值。但平方零点处,实际分布仍然右偏,宽度也大于零,标准差按 SE² 缩放。切线没捕捉到这部分波动。

一阶 Delta 项是导数乘误差,导数为零后,二阶项成了主要部分。在这里的正态演示模型下,平方值除以 SE² 就服从 χ²₁。

近似需要检查适用性
图 8-6:近似需要检查适用性

“超过 30 个样本”不能作为统一的适用门槛。偏斜、重尾或稀有事件可能影响近似,边界和不可识别还可能使推导失效。解析特例、模拟校准与敏感性分析都应结合具体模型使用;模拟只检查设定的模型,不能证明真实数据符合它。

实验:同均值同方差下的正态近似差异

两种标准化均值的理论均值均为 0、方差均为 1。指数样本与稀疏 Bernoulli 样本在 n=30 时,却未必同样接近正态。根据分布的偏斜和格点性质,判断哪一种可能更明显地偏离。

在两种分布之间切换,n=1、5、30、100 展示不同的抽样分布。保持 n 不动,将重复组数从 2000 增至 10000,则可以单独观察模拟精度的变化。

多重复几组,直方图会更稳定;改变 n,才会改变抽样分布本身。稀疏 Bernoulli 在 np 很小时,明显的格点和偏斜仍然在。

iid 和有限方差给出渐近保证,却没有一个统一的 n=30 门槛。比较结果时,也要分开两种误差:精确区间概率与正态概率之差是近似误差;模拟结果与精确值之差,是蒙特卡洛误差。

误差传播的条件与尺度

1
估计值为 4、标准误为 0.4。其倒数的一阶标准误约为多少?
2
Slutsky 定理在分母趋于非零常数时,仍要求分子与分母对每个样本量都独立。
3
固定模型与单次信息,把样本量增加到原来的 9 倍,标准误变成原来的几分之一?填写分母。

11. 练习:近似的依据与适用范围

练习 1|量级判断。 令 Z∼N(0,1)Z\sim N(0,1)Z∼N(0,1)、Rn=Z/n3/4R_n=Z/n^{3/4}Rn​=Z/n3/4。判断它是否为 oP(n−1/2)o_P(n^{-1/2})oP​(n−1/2),再判断 nRn\sqrt nR_nn​Rn​ 与 nRnnR_nnRn​ 的表现。

Rn/n−1/2=Z/n1/4→P0R_n/n^{-1/2}=Z/n^{1/4}\to_P0Rn​/n−1/2=Z/n1/4→P​0,所以是。nRn→P0\sqrt nR_n\to_P0n​Rn​→P​0,但 nRn=n1/4ZnR_n=n^{1/4}ZnRn​=n1/4Z 不在概率上有界。对任意固定 MMM,P(∣nRn∣>M)=P(∣Z∣>M/n1/4)→1P(|nR_n|>M)=P(|Z|>M/n^{1/4})\to1P(∣nRn​∣>M)=P(∣Z∣>M/n1/4)→1。同一余项能否忽略取决于最后采用的尺度。

练习 2|解释一个证明漏洞。 有人说:“Mn(θ)M_n(\theta)Mn​(θ) 对每个固定 θ\thetaθ 都收敛,所以最大点一定收敛。”指出缺少什么,并用第 6 节的三个间隙量完成修正后的论证。

缺少对整个候选区域的控制,以及真值与远处候选的正间隙。记间隙为 Δε\Delta_\varepsilonΔε​,当一致误差小于其三分之一,远处候选至多达到 M(θ0)−2Δε/3M(\theta_0)-2\Delta_\varepsilon/3M(θ0​)−2Δε​/3,真值处至少达到 M(θ0)−Δε/3M(\theta_0)-\Delta_\varepsilon/3M(θ0​)−Δε​/3;两者仍差三分之一间隙,最大点不能在远处。仅逐点收敛无法保证这两个界对随样本移动的最大点同时有效。

练习 3|完整得分推导。 iid 计数服从 Poisson⁡(λ)\operatorname{Poisson}(\lambda)Poisson(λ),真值 λ0>0\lambda_0>0λ0​>0。推导 MLE、证明一致、分别求得分方差与随机点曲率极限,再给大样本标准误。不能只引用“MLE 通常正态”。

ℓ=∑Xilog⁡λ−nλ+C\ell=\sum X_i\log\lambda-n\lambda+Cℓ=∑Xi​logλ−nλ+C,内点解为 λ^=Xˉ\hat\lambda=\bar Xλ^=Xˉ,由 LLN 一致;全零样本概率 e−nλ0→0e^{-n\lambda_0}\to0e−nλ0​→0,不妨在闭参数空间将该事件定义为 0。单次得分 u=X/λ−1u=X/\lambda-1u=X/λ−1,真值处均值 0,方差 1/λ01/\lambda_01/λ0​。随机中间点处的平均负曲率为 Xˉ/λ~2→P1/λ0\bar X/\tilde\lambda^2\to_P1/\lambda_0Xˉ/λ~2→P​1/λ0​,因为两个量分别趋于 λ0\lambda_0λ0​、λ0\lambda_0λ0​。得分 CLT 与 Slutsky 给 n(λ^−λ0)→dN(0,λ0)\sqrt n(\hat\lambda-\lambda_0)\to_dN(0,\lambda_0)n​(λ^−λ0​)→d​N(0,λ0​),标准误估计为 Xˉ/n\sqrt{\bar X/n}Xˉ/n​。这份推导逐项对应第 7 节,同时处理了零样本事件。

练习 4|换一个真正的目标。 在上一题中,希望估计一个长度为 2 的未来窗口没有事件的概率 q=e−2λq=e^{-2\lambda}q=e−2λ。给出估计值、渐近方差和标准误公式;窗口单位与速率单位一致。

q^=e−2Xˉ\hat q=e^{-2\bar X}q^​=e−2Xˉ,g′(λ)=−2e−2λg'(\lambda)=-2e^{-2\lambda}g′(λ)=−2e−2λ。因此 n(q^−q)→dN(0,4λe−4λ)\sqrt n(\hat q-q)\to_dN(0,4\lambda e^{-4\lambda})n​(q^​−q)→d​N(0,4λe−4λ),标准误估计为 2e−2XˉXˉ/n2e^{-2\bar X}\sqrt{\bar X/n}2e−2XˉXˉ/n​。目标是未来事件概率,随机的是它的估计量;并没有为参数本身构造概率分布。

练习 5|同一单位记录两个量。 80 对观测的均值为 4 与 2,方差估计为 4 与 1,协方差估计为 1.5。求均值比的一阶标准误,并说明把数据配对打乱为何可能改变结论。

代入第 8 节公式,个体级渐近方差为 4/4+16/16−2⋅4⋅1.5/8=0.54/4+16/16-2\cdot4\cdot1.5/8=0.54/4+16/16−2⋅4⋅1.5/8=0.5,估计标准误 0.5/80≈0.0791\sqrt{0.5/80}\approx0.07910.5/80​≈0.0791。删掉协方差则成为 2/80≈0.1581\sqrt{2/80}\approx0.15812/80​≈0.1581。配对关系包含两种量共同变化的信息;任意打乱后,计算的不再是原观察机制下的协方差。

练习 6|一阶退化。 对 iid 均值为零、方差为 σ2>0\sigma^2>0σ2>0 的非正态观测,说明 nXˉ2/σ2n\bar X^2/\sigma^2nXˉ2/σ2 的极限分布。与正态总体时的结论有什么区别?

CLT 给 nXˉ/σ→dN(0,1)\sqrt n\bar X/\sigma\to_dN(0,1)n​Xˉ/σ→d​N(0,1),对连续的平方函数使用连续映射,得到 nXˉ2/σ2→dχ12n\bar X^2/\sigma^2\to_d\chi^2_1nXˉ2/σ2→d​χ12​。非正态总体下一般只是渐近结论;正态总体下对每个样本量都是精确等式。平方函数在 0 处的一阶导数为零,只表示 n\sqrt nn​ 尺度的极限退化。

练习 7|错误模型下重新报告。 64 个独立正观测有均值 5、标准差 8。用指数似然得到的点估计是什么?比较模型内信息标准误与只基于有限方差的 Delta 标准误,并分别写出它们所估计的对象。

点估计都为 1/5=0.21/5=0.21/5=0.2。指数模型标准误 0.2/8=0.0250.2/8=0.0250.2/8=0.025;一般 Delta 标准误 8/(25⋅8)=0.048/(25\cdot8)=0.048/(25⋅8)=0.04。若指数模型正确,参数可解释为恒定速率;仅假设有限均值方差时,目标是总体平均的倒数。后者避免了方差等于均值平方这一限制,但仍需独立观测和合适的大样本近似。

练习 8|分布收敛不控制期望。 令 Wn=nW_n=nWn​=n 的概率为 1/n1/n1/n,其余时候为 0。证明 Wn→P0W_n\to_P0Wn​→P​0,并算期望。这对解读渐近正态结论有什么提醒?

对固定 ε>0\varepsilon>0ε>0 和足够大的 nnn,确有 P(∣Wn∣>ε)=1/n→0P(|W_n|>\varepsilon)=1/n\to0P(∣Wn​∣>ε)=1/n→0,但 E(Wn)=1E(W_n)=1E(Wn​)=1 始终不趋零。那些越来越少见的巨大值,仍然撑住了期望。所以从分布极限读误差形状时,别顺带断言偏差和方差也收敛;矩还得另证,或补上尾部控制。

下一章会用标准误构造区间。这里的近似将成为依据:目标、主导误差与余项为什么可忽略,都需要能够在具体模型中说明。

上一章信息与最优性:估计精度的界限下一章置信区间:构造并解释覆盖保证