逐个比较估计公式,无法排除所有尚未想到的候选。信息不等式能约束整个无偏估计类;在某些模型里,充分性与完全性还可直接证明最优性。
1. 得分衡量参数方向上的局部变化
样本均值使用了全部观测,但这还不是最优性的证明。要排除任何其他无偏规则具有更小方差的可能,可以证明一个适用于整个候选类的下界,并检查样本均值能否达到。下界不适用时,充分性与完全性提供了另一条证明路线。
对数似然 ℓ(θ;X) 关于参数的局部导数写成
Uθ(X)=∂θ∂ℓ(θ;X)
这个导数叫得分函数。得分为正,局部增大参数会提高对数似然;得分为负,就往相反方向变化。可微内点最大值处通常为零。这里的“得分”描述变化方向,还不是标准化后的证据强度。
图 7-1:得分是似然的局部斜率
对一个伯努利观测,Up(X)=X/p−(1−X)/(1−。这个公式只在 内直接可用。若 是真参数,则 ,所以 。
一般模型里,得分均值为零来自对归一化条件求导:若允许交换微分与积分,
Eθ(Uθ)=∫
这一步交换了求导和积分,合法性需要条件。下面的指数模型可以验证这些条件,均匀模型则会显示交换失败时遗漏了什么。
求导与积分交换的充分条件
一种常用的充分条件是:真值附近的密度一阶、二阶参数导数分别被可积的函数控制。这样可以用控制收敛把导数移入积分。对指数模型,若真值 λ0>0,先限制在 [λ0/2,3λ0 的邻域;密度导数是某个低次多项式乘 ,其绝对值可被常数乘 控制。后者在正半轴可积,所以所需交换有依据。
这个邻域只用来证明固定真值附近的局部论证合法,没有要求参数永远限在里面。如果还要对估计量 T 的无偏性求导,乘上 T 后是否可积也得查。只查密度本身,还覆盖不了所有统计量。
2. Fisher 信息:局部可区分程度
在正则条件下,定义单次观测信息
I1(θ)=Eθ[U
在允许相应二阶微分交换的条件下,也有
I1(θ)=−Eθ[
图 7-2:信息量与曲率
从得分的零均值恒等式再求一次导数,可以联系两个信息公式。设 u=∂θlogfθ,已有 ∫uf,乘法法则给出
0=∫[(∂θu)fθ+
这里用了 ∂θfθ=ufθ,移项才得到 。所以这不是任意函数都成立的导数关系;归一化和求导交换的条件都参与了证明。
以指数速率为例,u=1/λ−X,所以 E(u2)=Var(X)=1/λ;另一方面 ,两条路径给同一结果。以一个泊松观测为例,,观测负曲率为 ,它会随样本改变;期望信息才是 。
期望负曲率越大,参数局部偏离时,似然越容易显示差别。这里的期望信息 I 与当前样本的观测信息 J(θ;x)=−ℓ′′(θ;x) 要区分。适当的大样本条件可以联系它们,却不意味着二者数值和含义相同。
换单位还会改变信息的数值。比如时间从秒换成毫秒,参数尺度变了,信息也要跟着变。跨参数或跨单位比较之前,得先有共同的误差尺度。
两个直接计算的例子:伯努利概率的信息为 I1(p)=1/[p(1−p)];已知方差正态模型关于均值的信息为 I1。后者来自 的方差。
稀有事件的绝对精度与相对精度
伯努利模型里 I1(p)=1/[p(1−p)],p 越小,这个数越大。可罕见事件恰好经常一例都观察不到。这并不矛盾:信息下界说的是当前参数尺度上的局部绝对精度,没有保证相对误差小,也没保证有限样本近似好。
样本比例的标准差为 p(1−p)/n,除以真值 p 后,相对标准差为
np1−p.
若 p=0.01,n=100,绝对标准差约 0.00995,但相对标准差约 99.5%。一份数据可以在绝对数值上波动不大,却仍不足以把一个很小的概率估得相对准确。并且此处 np=1,全失败样本仍常见,不能把信息公式顺手变成可靠的正态区间。
目标改为 η=log[p/(1−p)] 时,链式法则给出关于 η 的单次信息 p(1−p)。数据和模型都没变,参数坐标却改变了信息数值。比较信息大小之前,需要统一参数和单位。
参数换单位时,用链式法则同步换信息
若 η=g(θ) 为可微的一一变换,其逆导数存在,则 uη=uθ(dθ/,从而 。所以在同一点附近,二次量 不变;改变的是坐标上的数字。
对伯努利对数赔率,p=eη/(1+eη),dp/dη=p(,得到 。这与 一大一小,却没有矛盾。讨论“精度”之前,先说误差是按概率点、百分点还是对数赔率衡量。
3. 独立样本的信息可加性
iid 样本的对数似然是各项相加,所以总得分为 Un=∑Ui。各得分独立且均值为零,因而
In(θ)=E(Un2)=∑
图 7-3:独立信息可以相加
独立但不同分布时,在适当条件下仍可把各项信息相加,却未必是某个共同 I1 的 n 倍。若观测相关,就得回到实际联合分布计算,不能直接沿用这一步。
例如正态测量的已知标准差为2,25次独立观测关于均值的总信息是 25/4=6.25,100次为25。与后面的方差下界结合,会得到样本量四倍、标准误减半的熟悉规律。
4. Cramér–Rao 无偏方差下界
设 T 是 θ 的无偏估计,方差有限,模型满足正则条件。对 Eθ(T)=θ 求导,交换微分与积分得
1=Eθ(TUn)=Covθ
最后一步用了 E(Un)=0。由 Cauchy–Schwarz 不等式,
1≤Varθ(T)Varθ(U
因此
Varθ(T)≥In(θ
图 7-4:Cramér–Rao 下界
如果估计的是可微函数 τ(θ) 且 T 对它无偏,则右侧改为 [τ′(θ)]2/I。存在偏差时不能直接套这个无偏版本;偏差导数也会进入相应的一般信息不等式。
已知方差正态模型中,Xˉ 的方差为 σ2/n,正好等于下界,因此在该模型、无偏估计类与方差准则下达到最优。伯努利样本比例也达到 p(1−p)/n 的下界。
有了下界,还要检查能不能达到。等号要求中心化估计量与得分几乎处处成比例;若找不到符合要求的统计量,这条界就只是参照。有偏收缩估计的 MSE 即使更低,也没有违反只约束无偏估计的定理。
实验:期望信息与观测信息的变化
固定 n 和 p₀,成功次数改变会影响当前似然。根据两个信息量的定义,判断其中哪一个会随这份记录变化。
n=25、p₀=.60、k=15 给出初始曲线,将 k 改成 4 可观察样本结果的影响。n=100、k=60 则适合比较样本量四倍时的下界。
k 改变时,橙色曲线的倾斜和曲率都变了,深色期望曲线与 Iₙ 却不动。把样本量增到四倍,CRLB 降为原来的四分之一。
观测信息取当前样本的负二阶导数,期望信息则把所有可能样本平均。图中的二次虚线只在 p₀ 附近近似期望曲线,不能拿它替代远处的整条曲线。
把正态均值的下界证明一遍
已知方差 σ2 的 iid 正态模型可以完整展示证明。目标是确定样本均值是否达到估计 μ 的无偏方差下界。
从对数密度求关于均值的导数,单次得分为 (Xi−μ)/σ2。总得分是 ;它的均值为零,方差为 。
这次证明里,有两处不能省:候选限定为无偏估计,得分的归一化求导也必须合法。若改变其中一处,就得重新检查,不能只记一句“均值最稳定”。
一般目标与有偏规则的信息界
若 m(θ)=EθT 可微,刚才的同一证明给
Varθ(T)≥In(θ)
估计目标为 τ(θ) 时,设偏差 b=m−τ,于是分子为 [τ′+b。在平方风险中还要加回 。这解释了有偏估计为何可以有比无偏界更小的方差:它连“平均随参数移动多快”都改变了。
例如已知方差为 v 的正态均值模型,T=cXˉ,其中 c 事先固定。它的平均为 cμ,一般信息下界为 c,正好等于其方差;但估计 的 MSE 是 。若只对比方差、不写偏差和参数范围,就会把缩小数字误当成无条件提高估计质量。
等号条件与可实施的估计规则
当目标无偏且 In>0,Cauchy–Schwarz 取等要求
T−τ(θ)=In(θ)τ
移项后虽然能写出 T 的表达式,还得检查它是否含未知参数。统计量必须用同一条可计算规则处理所有参数;若做不到,就没有规则能在所有参数处达到这条界。
例如伯努利模型估计 p2,代入 Un=(S−np)/[p(1−、,取等将要求 。这个式子仍依赖未知 ,不能作为通用统计量。因此找到 UMVU 后,它也未必达到这条信息界;后面会算出确切差距。
5. 支持变化会破坏常用证明
图 7-5:正则条件是一扇门
这组常用充分条件要求参数位于开集内、支持固定、对数密度足够光滑。相关求导还必须能与积分交换,信息应为正且有限。均匀模型的支持会随参数移动,下面可以看到证明在哪一步失效。
均匀 [0,θ] 模型中,若只对支持内部的 −nlogθ 求导,会得到总得分 −n/θ,其期望不是零。原因是积分的上界也随 θ 移动,直接交换时遗漏边界贡献。这个模型不能套刚才的正则无偏下界。
用单个观测就能定位遗漏的项:
dθd∫0θ
只留下积分内导数会得到 −1/θ,漏的恰好是移动上限的贡献。多个样本时,支持区域也随参数扩大,道理相同,边界项仍不能省。
无偏上界估计 θ~=(n+1)M/n 的方差为 θ2/[n(n+,数量级是 ;常见正则参数估计的方差数量级则是 。这里估得更快,有一个具体原因:参数改变时,哪些观测可能出现也跟着变,支持本身带来了信息。
实验:最大值逼近上界的速度
最大值与上界的典型间隙按 1/n 的量级缩小。用这一关系判断样本量增至四倍时的变化,再与模拟中的间隙比较。
固定 θ=2,将 n 从 10 改为 40,样本带同时显示 M、无偏修正及缩放间隙密度。“换一组样本”会改变这一次结果,分布规律却由同一模型决定。
无偏修正的标准差按 1/n 量级下降,W=n(θ−M)/θ 的密度逐渐靠近 Exp(1)。某一批里,修正估计也可能超过真实上界,别把典型速度当作每次都从下方接近的保证。
Uniform 的支持依赖 θ,积分会带上边界项,因此不能直接认定得分均值为零。刚才正则模型中的信息相加和 CRLB 证明,也就不能原样搬来。
6. 多参数信息与矩阵逆
如果参数有两个分量,得分也是两个分量,信息矩阵记录它们的方差与协方差。设总信息为
In=(ab
估计第一参数时,其他参数未知对应的方差下界是逆矩阵第一对角元素
(In−1)11=ac−
这里不能只取 1/a。第二参数确实已知时,下界才是 1/a。被扣除的 b2/c 来自两个得分方向的重叠:你以为是第一参数造成的变化,第二参数也可能解释一部分。
取 In=(8222),第二参数未知时第一参数界为 ,已知时为 。不能只看 就跳过联合不确定性。第 11 章将把同样的扣除用于有干扰参数的得分检验。
更一般的目标 τ(θ) 的无偏下界为 ∇τTIn−1∇τ。它可由一个非负方差证明:令 ,利用 展开,得到 。矩阵逆由消去与得分相关的线性部分自然出现。
7. 完全性:用另一条路径确认最优
统计量 T 的分布族称为完全的,若任何满足 Eθ∣g(T)∣<∞ 且对所有参数有 Eθ 的函数,都必须满足 几乎处处。它排除了一个“处处零均值却非零”的歧义方向。
图 7-6:完全性与唯一性
伯努利总数的证明。 对 S∼Bin(n,p),假设 ∑s=0ng 对每个 成立。除以 ,令 ,得到一个对所有正 都为零的多项式。它的每个系数都必须为零,所以 。因此 完全;第 6 章又已证明它充分。
Lehmann–Scheffé 结论。 如果 T 完全且充分,h(T) 对目标参数函数无偏并有有限方差,那么它是在所有无偏估计量中一致最小方差的估计,简称 UMVU,且在几乎处处意义下唯一。
任意无偏竞争者经过 Rao–Blackwell 条件平均,都变为风险不增加的 T 的函数。两个这样的无偏函数之差,在所有参数处的期望为零,完全性便迫使它们几乎处处相同。这就完成了对整个无偏估计类的比较。
例如 S/n 是 p 的 UMVU;n≥2 时,S(S−1)/[n(n− 对 无偏,也因此是 的 UMVU。无偏性可由 的期望验证。
完全性中“对所有参数”的要求
令 g(S)=S−n/2。当 p=1/2 时它的期望为零,但它显然不是处处等于零。这个例子不违反完全性,因为完全性要求同一个函数在每一个允许的 p 下期望都为零。事实上 ,其他参数处不会消失。
第 6 章已经给出 p2 的无偏估计 S(S−1)/[n(n−1)]。现在任取另一个无偏估计,先条件化成 S 的函数,方差不会增加。再与候选相减,差对每个 都零均值,完全性便使它们几乎处处相同。这个证明一次比较了全部无偏竞争者。
说 UMVU 时,“无偏”这两个字要一起读:它在每个参数处的方差都不大于其他无偏估计。允许有偏、换一种损失之后,还要重新比较,第 3 章的收缩例子仍然成立。
8. 连续模型中的完全性,也能亲手证明
对 iid Uniform[0,θ],最大值 M 的密度是 nmn−1/θn,。假设同一个可测函数 对所有 都可积且满足 ,则
∫0θg(m)mn−1dm=0对每个 θ>
左边是上限为 θ 的积分。因为被积函数在每个有限区间上可积,这个积分函数绝对连续,导数几乎处处等于 g(θ)θn−1。积分函数恒为零,因此 g(θ)θn−1= 几乎处处;在正半轴上权重为正,所以 几乎处处,也即在每个最大值分布下几乎必然为零。于是 完全。
题目没有假定 g 连续,因此只能得到几乎处处为零,不能扩大为每个点都为零。密度分布赋予单点的概率为零,这种区别不影响相应统计结论。
第 6 章已证明 M 充分;又由积分
Eθ(Mk)=θ
由此, nn+kMk 是 θk 的 UMVU。证明使用充分性与完全性,没有依赖正则得分恒等式,因而支持移动不妨碍这条路线。
9. UMVU 与信息下界之间的差距
令 A 为任意有限方差无偏竞争者。对充分的 T 条件化,得到 A∗=E(A∣T);第 6 章保证该规则可实施、无偏且方差不增加。已有无偏候选 h(T),两者之差满足 ,对所有参数成立。完全性给出 几乎处处,因此每个参数处都有 。竞争者若风险也相同,被消去的条件方差必须为零,它就与候选几乎处处相同。
证明依赖的是充分性、完全性以及估计的无偏和有限方差,并未要求达到 Cramér–Rao 界。以伯努利目标 p2 的候选
H=n(n−1)S(S−1)
为例,记下降阶乘 (s)k=s(s−1)⋯(s−k+1)。 数的是互不相同的 个位置同时成功的有序组合,故 。展开多项式可核验 ,取期望再减 ,得到
Var(H)=n4p3(1−p)+
第一项恰是估计 p2 的信息下界,第二项在内部参数处却严格为正。代入 n=4,p=1/2,界为 1/16,真实方差是 7/96。这不是还没找到更好的无偏估计:规则已经是 UMVU,只是这条信息下界没能贴到真实最小方差。
完全性、充分性与最小充分性的区别
充分性要求压缩后的剩余条件分布不再含参数;在这个要求之下,最小充分性进一步去掉仍可合并的区分。完全性研究的则是统计量的函数:能否存在一个非零函数,对所有参数都具有零期望。三者不能凭名称互推。恒定统计量 T≡0 的任何函数都只是常数,零期望迫使常数为零,所以它完全,却通常没有保留参数信息,因而不充分。
给“最优”加上正确的限定
1某个有偏估计的 MSE 小于 Cramér–Rao 无偏方差下界,首先应得出什么结论?
2运用完全性时,必须检查同一个函数对所有允许参数的期望都为零。
3正态均值模型的已知方差为 9,独立样本量为 36,关于均值的总 Fisher 信息是多少?
10. 练习:亲手证明“最优”
练习 1|两条路径算信息。 对一个指数速率观测,分别由得分平方期望与负二阶导数计算单次信息。若目标改为平均时间 μ=1/λ,关于 μ 的信息是什么?
uλ=1/λ−X,均值零、方差 1/λ2;负二阶导数同样为 1/λ。因为 ,信息变为 。写相同的形式不表示单位相同,要随所用参数解释。
练习 2|有偏版本。 已知正态方差为 16、样本量为 25,规则 T=0.8Xˉ 用于估计均值。求它的方差、偏差、MSE,并核验一般信息界。
总信息 25/16,m′(μ)=0.8,一般方差界为 0.64⋅16/25=0.4096,恰为其方差。偏差为 ,MSE 为 。它的方差小于无偏界 0.64 不矛盾,因为平均函数的导数也缩小了。
练习 3|目标不是参数本身。 伯努利目标为 p(1−p),写出无偏方差下界。在 p=1/2 时下界为零,是否存在处处正确的零方差估计?
目标导数为 1−2p,界为 (1−2p)2p(1−p)/n。在 p 为零只是局部下界没有约束力。一个对所有 无偏的规则不能据此在不知道参数的情况下恒等于真值;例如第 6 章的无偏估计 在该点仍随机。
练习 4|完全性的量词。 对 S∼Bin(n,p),有人用 g(S)=S−n/3 在 p= 处零期望反驳完全性。指出错误,并说明为什么多项式证明需要整个参数区间。
完全性要求同一个函数对所有允许的 p 都零期望,这里的期望却是 n(p−1/3),只在一点为零。多项式在一点为零,只说明有一个根;在整个正区间为零,才会迫使所有系数为零。错误就在把“每一个参数”换成了“某一个参数”。
练习 5|完整 UMVU 构造。 均匀上界模型有 n=5,目标为 θ2。给出 UMVU,证明无偏,并写清完全性与充分性分别在哪一步使用。
候选为 7M2/5。由 E(M2)=5θ2/7 可知无偏,且有有限方差。充分性使任意竞争者可条件化成 的函数而不增风险;完全性使任何两个这样的无偏函数几乎处处相同。因此该候选在所有无偏估计中方差最小。无偏性不能由“充分”二字代替。
练习 6|计算 UMVU 的真实方差。 在上一题中,用 E(M4) 求候选的方差。为什么不能直接拿正则信息界当它的方差?
E(M4)=5θ4/9,因此方差为 (49/25)(5/9)θ。该模型支持随参数移动,常规得分零均值证明失效;即使在正则模型中,信息下界也不自动等于最优估计的方差。
练习 7|干扰参数的代价。 总信息矩阵为 (10332)。第二参数已知与未知时,第一参数的无偏方差界各是多少?
已知时为 1/10;未知时为 1/(10−9/2)=2/11≈0.1818。行列式为 11、矩阵正定,逆存在。第一对角元素的倒数忽略了与第二得分方向重叠的部分,给出了过于乐观的界。
练习 8|最优结论能否跨出模型。 S/n 在 iid 伯努利模型中达到无偏方差下界。若所有 Xi 实际都等于同一个伯努利随机变量,原结论哪一步失败?实际方差是多少?
此时 S/n=X1,方差是 p(1−p)。实际联合似然不是 n 个独立质量的乘积,信息也就不能乘以 n。比例仍然无偏,但整批数据只有一份独立随机信息,精度评价需要回到这个联合模型。