上一章里,我们认识了随机变量、期望、方差和正态分布。那些概念看起来像是在研究“一个随机结果会怎样变化”,但它们真正厉害的地方,是能把我们从一个样本带到看不见的总体。
先看一条很常见的新闻:某次民调随机访问了 名选民,其中 人支持方案 A,于是报道说“A 的支持率是 ”。
这句话少说了一层意思。 是这 人给出的结果,不是刻在全部选民身上的答案。如果明天换一批 人,可能得到 ,也可能得到 。这并不说明哪次民调“算错了”,而是随机抽样本来就会摇晃。
统计推断要做的,就是把这种摇晃算进去。我们既给出当前最合理的单点估计,也诚实说明这个估计有多不稳定。

这章的主线可以先记成一句话:参数是我们想知道的总体真值,统计量是样本给出的线索,标准误描述线索会摇多大,置信区间则把“估计值”和“估计精度”放在一起报告。
总体参数和样本统计量在形式上经常很像,含义却完全不同。
如果样本里有 个我们关心的结果,样本量是 ,样本比例就是:
如果样本记录的是数值 ,样本均值就是:
某平台想知道全部活跃用户中有多少人愿意开启新功能。它随机邀请 名活跃用户试用,其中 人选择开启。
研究对象是平台的全部活跃用户,所以总体是全部活跃用户,而不是被抽到的 人。
平台真正想知道的是总体中愿意开启功能的比例。这个固定但未知的参数记作 。
样本里有 人开启,样本量是 ,所以样本统计量是:
点估计的优点是干脆,缺点也正是太干脆。只说“支持率 ”,读者看不出这是从 人、 人还是 人中算出的;而这三种样本提供的精度显然不同。
想象我们知道某个巨大总体里真实支持率恰好是 。现在每次随机抽 人,记录样本支持率,然后把人放回去,再重新抽 人。
第一次可能抽到 人支持,得到 ;第二次可能是 人,得到 ;第三次也许正好是 人。所有抽样步骤都没有出错,结果仍不会次次一样。
这种由随机抽到不同对象而产生的变化,叫抽样变异。某一次统计量与总体参数之间的差,叫这次估计的抽样误差。例如真实比例是 ,某次样本得到 ,这次误差就是:
也就是低估了 个百分点。
这两个词很容易被混在一起,但它们造成的图景完全不同。
“样本很大”只能让随机摇晃变小,不能自动让样本变得有代表性。十万份带有严重自选偏差的网络投票,完全可能不如一千人的规范随机样本可靠。
如果我们把刚才的抽样重复成千上万次,并把每次得到的 都收集起来,这些样本比例也会形成一个分布。它叫样本比例的抽样分布。

这里最容易错认对象。原始数据分布描述的是“一个个受访者怎样回答”;抽样分布描述的是“一个个样本算出的比例怎样变化”。前者的一次观测是一位受访者,后者的一次观测是一个完整样本产生的统计量。
在互动器里把总体比例固定,先用较小样本重复抽样,再把样本量调大。你会看到两件事:点云的中心仍在总体比例附近,但样本越大,点云越挤。这正是后面所有区间公式的出发点。
把“支持”记为 ,“不支持”记为 ,那么一份样本中这些 和 的平均数,恰好就是样本比例 。当独立观测越来越多时,这个平均数会越来越靠近总体期望,也就是总体比例 。
这就是大数定律在这里的意思:大量重复后,平均或比例会稳定下来。
它没有说小样本一定离真值很远,也没有说大样本每一次都完全等于真值。它说的是,给定一个允许误差,例如 ,样本量越大,样本比例落在这个误差带内的机会会越来越高。
既然抽样分布有宽有窄,我们需要一个数来描述它的宽度。这个数叫标准误。
标准误可以理解成:如果真的反复抽取同样大小的随机样本,统计量偏离总体参数的典型尺度有多大。
这和上一章的标准差很像,但对象不同:
如果总体比例 已知,样本比例抽样分布的标准误是:
现实里我们做调查,恰恰是因为 不知道。因此在估计区间时,常把 代进去:
注意帽子表示“这是用样本估出来的标准误”。入门计算里经常把帽子省掉,只写 ,但我们心里要知道它仍带着样本不确定性。
如果总体标准差 已知,样本均值的标准误是:
总体标准差通常也不知道,所以实际中常用样本标准差 代替:
两类标准误公式的分母都有 。这带来一个很实用、也很反直觉的结论:精度的提升没有样本量增长得那么快。
假设总体比例接近 :

样本量从 增加到 ,变成原来的 倍,标准误才从 降到 ,也就是减半。想把标准误压到原来的三分之一,通常需要把样本量扩大到 倍。
平方根关系解释了为什么追求最后一点精度会很贵。把误差范围从 个百分点压到 个百分点,不是多调查一倍人,而是大约需要四倍样本。
抽样分布为什么常常接近正态分布?直觉上可以这样看:样本均值是许多独立小贡献汇总后的结果。单个观测可能很不规则,但大量贡献相加再平均后,中间情况的组合方式很多,极端情况的组合方式很少,于是整体逐渐形成中间高、两边低的钟形。
把条件说完整一些:若 独立同分布,总体均值为 ,总体方差 有限且不为 ,那么随着 增大,中心化并标准化后的样本均值趋近标准正态分布:
样本比例不是另一条毫不相干的结论。把“成功”记为 、“失败”记为 后, 就是一组 — 变量的样本均值,所以它是中心极限定理的一个特例。
这里必须收紧一句常见口号:中心极限定理并不自动保证“任意样本统计量”都接近正态。样本中位数、分位数、相关系数和回归系数都有各自的抽样理论;有些在额外条件下也会近似正态,有些要改用别的分布或重抽样方法,不能只凭“样本量大”就套钟形曲线。
接近正态的是样本均值或由它涵盖的特例的抽样分布,不是说原始数据突然变成正态分布。个人收入可以严重右偏,但足够大样本的平均收入仍可能有近似正态的抽样分布。同时,“样本量大”不能脱离数据形状单独判断;比例和均值要检查的实际条件也不完全一样。
对一样本比例,常检查:
如果某批产品抽 件,结果一件不合格品都没发现,那么 ,普通正态近似区间的条件明显不满足。这时不能因为公式算出标准误为 ,就宣布总体不合格率确定是 。需要改用适合稀有事件或小计数的方法。
对样本均值,先检查观测是否独立,再看原始数据的形状和样本量。
这两个定理经常一起出现,却回答不同问题。
前者解释“为什么越来越稳”,后者让我们能用正态曲线的临界值,把“稳到什么程度”算成区间。
点估计只给一个中心。区间估计则以点估计为中心,向两边留出与抽样不确定性相称的余量。
置信区间的共同骨架是:
其中:
也常把误差界叫作误差范围或区间半宽。标准误越大,区间越宽;想要的置信水平越高,临界值越大,区间也越宽。
当正态近似适用时,常见置信水平对应的临界值为:
这很像撒网:希望长期更少漏掉真值,就要把网撒得更宽。不能既要求更高置信水平,又在样本量不变时要求区间更窄。
当随机性和成功—失败条件都合适时,一样本比例的近似置信区间是:
我们用民调从头算一遍。随机访问 名选民,其中 人支持方案 A。求总体支持率的近似 置信区间。

先认清参数和统计量。未知参数是全部目标选民的支持率 ;样本比例为:
这里有一个很现实的结论:区间同时包含 以下和 以上的值。样本点估计虽然是 ,但仅凭这份样本,还不能把“总体支持率过半”说得很稳。
某工厂从一大批零件中随机抽检 件,发现 件不合格。样本不合格率是:

样本中不合格数为 ,合格数为 ,达到近似计算的基本条件。标准误约为:
误差界约为:
于是区间为:
也就是大约 到 。如果合同要求整批不合格率低于 ,这次结果不能让人放心:合理范围里仍有很多高于 的值。
这也提前埋下了下一章的问题:某个标准值落在区间里还是区间外,能帮助我们判断数据与这个标准是否相容。
这是整章最反直觉的地方,最好慢一点读。
假设总体比例 固定不动。我们重复执行同一种随机抽样,每次都抽同样多的人,再用同一公式构造 置信区间。由于样本不同,每次的区间端点也不同。有些区间会盖住 ,有些不会。

长期来看,这套方法构造出的区间大约有 会覆盖总体参数。这才是 置信水平的含义。
使用互动器时,先让样本量和总体比例满足成功—失败条件,再连续抽样。次数很少时,覆盖率可能是 、 甚至更极端;次数越来越多后,它才会在目标置信水平附近稳定。若把比例调得很靠近 或 ,同时把样本量调小,普通近似区间的条件会失效,覆盖率也可能明显偏离目标。
在这里采用的解释中,总体参数是固定的,随机的是样本和由样本算出的区间。某次样本已经抽完,区间也已经算成 后,参数要么在里面,要么不在里面,不会再以 的概率跳进跳出。
所以更准确的说法是:
我们使用了一种长期覆盖率为 的方法,并得到区间 到 。根据这份样本,这段范围是总体支持率的一组合理值。
而下面这些说法都不对:
置信水平是构造区间的方法在重复抽样中的长期命中率,不是给某个已经生成的区间贴上的“正确概率”。这句话听起来有点别扭,但它能挡住后面很多统计误读。
比例用 估计 ,均值则用 估计 。两者的区间骨架完全一样,差别主要在标准误和临界值。
如果总体标准差 已知,并且样本均值的正态近似合适,可以用:
但现实里,我们几乎总是不知道总体标准差。只能用样本标准差 代替 。这又多了一层估计误差,所以小样本时继续使用正态分布的 会显得过于自信。
t 分布就是为这层额外不确定性留余量。它和正态分布一样以 为中心、左右对称,但尾部更厚。样本越小,临界值通常越大;样本越大, 对 的估计越稳定,t 分布也越来越接近标准正态分布。
一样本均值的 t 区间是:
这里的自由度是:
某饮料厂随机抽取 瓶饮料,样本平均灌装量是 毫升,样本标准差是 毫升。假设数据没有严重偏斜或极端离群值,求总体平均灌装量的 置信区间。
未知参数是生产线的总体平均灌装量 ,点估计是 。总体标准差未知,所以使用 t 区间。
自由度为 。 置信水平下,临界值约为 。
注意,这个区间估计的是平均灌装量。它绝不表示 的单瓶饮料都在 到 毫升之间。单瓶之间的波动由标准差描述,通常比均值的标准误大得多。
到目前为止,我们估计的都是一个参数:一个支持率、一个不合格率或一个平均灌装量。但很多现实问题天生带着比较:新版页面的转化率比旧版高多少?两种配送方式的平均用时差多少?同一批人接受训练前后,平均改变多少?
这些问题的共同形式仍然是:
真正需要先想清楚的是数据结构。两组对象彼此独立时,要把两组抽样不确定性合在一起;同一个对象测量两次时,两次数据天然成对,要先在每一对内部做差。
假设 A、B 两组的总体比例分别是 和 。我们关心的参数可以写成:
对应的点估计是:
直觉上,两组样本比例都会摇晃,所以差值的不确定性不能只看其中一组。两组独立时,方差相加,标准误为:
于是两比例差的近似置信区间是:
这里每组都使用自己的样本比例,因此叫非合并标准误。我们正在估计 ,不能先假设两组总体比例相等。
常见条件包括:
旧版 A 有 名访客,其中 人完成注册;新版 B 有 名访客,其中 人完成注册。假设两组访客独立分配,估计新版相对旧版的转化率差。
两组样本转化率分别是:
构造两比例差区间时使用两组各自的比例,不合并。下一章检验 时,零假设明确规定两组共享同一个总体比例,因此计算零假设下的标准误时常改用合并比例 。区间和检验看起来相似,但标准误回答的问题不同。
零假设下常见的合并标准误写成:
这里的下标 提醒我们:它描述的是“两组真实比例相等”这个零假设世界里的波动,不是两比例差置信区间所用的标准误。
提醒方式 A 的 名用户中有 人完成任务;方式 B 的 名用户中有 人完成任务。用 构造 的近似 置信区间。
现在把结果换成数值,例如配送分钟数、考试分数或设备寿命。若第 1 组和第 2 组由不同对象组成,我们关心的参数是:
点估计是 。两组均值各自会摇晃,所以差值的估计标准误为:
最常用的做法是 Welch t 区间:
Welch 方法不要求两个总体方差相同。它的自由度不是简单的 ,而是由两组样本量和方差共同决定。软件通常会直接给出;手算时可以使用近似式:
计算器或统计软件可能保留小数自由度,也可能向下取整查 t 表。两者会让最后几位略有差异,但推断逻辑不变。
需要检查:
配送方式 A 随机抽取 个订单,平均用时 分钟,样本标准差 分钟;配送方式 B 独立抽取 个订单,平均用时 分钟,样本标准差 分钟。估计 。
差异的点估计是:
这里没有把两组标准差强行当成一样。若 A 组波动明显大于 B 组,Welch 标准误和自由度会把这种差异带进区间。
教学方式 A 有 名学生,样本均值 、样本标准差 ;方式 B 有 名独立学生,样本均值 、样本标准差 。若 Welch 自由度近似为 ,取 ,构造 的 置信区间。
有些“两组数据”其实不是两组独立对象。例如同一个人在训练前后各测一次血压,同一台机器调整前后各测一次能耗,或者把条件相近的两个人配成一对。每个“后”都对应一个特定的“前”,这种数据叫配对数据。
配对的价值在于先消掉个体之间的稳定差异。有人本来血压高,有人本来血压低;直接比较两列原始数据会把这种个体差异混进噪声。对第 对先定义差值:
然后问题就变成:差值总体的平均数 是多少?区间和一样本均值完全相同:
这里的 是配对数, 是一列差值的样本标准差,不是把前后两列的标准差分别代入。
需要检查:
随机抽取 名参与者,在训练前后测量收缩压。定义 ,样本平均差为 毫米汞柱,差值标准差为 毫米汞柱。假设差值没有明显离群值,估计平均降低量。
因为差值定义为“前减后”,正数表示训练后降低。目标参数是全部同类参与者的平均差 。
标准误使用差值标准差:
如果误把前后测量当成两组独立数据,就丢掉了“同一个人对应同一个人”这条重要信息。配对分析不是另一套神秘公式,它只是先把每一对压缩成一个差值,再做一样本 t 区间。
对 台机器分别记录调整前后每小时能耗,定义 。得到 千瓦时, 千瓦时。取 ,构造平均节能量的 置信区间。
三类比较区间可以用一句话分开:比例结果比较两个率,用两比例差;不同对象的数值结果比较两个均值,用 Welch t;同一对象测两次或有明确匹配关系,先做差,再用一样本 t。先判断数据结构,比背公式更重要。
调查做完后才嫌区间太宽,往往已经来不及。更好的做法是在收集数据前先问:“我希望误差界最多是多少?大概要抽多少人?”
对比例的近似区间,目标误差界 满足:
解出样本量:
问题是,研究开始前 还不知道。可以有两种做法:
希望在 置信水平下,把比例估计的误差界控制在 以内,又没有旧调查可参考。取 :
样本量必须向上取整,所以至少需要:
不能向下取成 ,因为规划目标是“误差界不超过 ”。实际执行中还要预留无回应、无效问卷和分层分析的需求,因此联系人数通常会比 更多。
如果想把误差界从 个百分点压到 个百分点,也就是减半,样本量大约要变为四倍。公式里的 正好体现了这个代价。
均值区间的误差界近似为:
于是可以先用历史数据或预调查估计 ,得到初步样本量:
正式分析时,因为 通常未知,仍会使用 t 区间。样本量规划里的 只是提前估算所需规模的工作值,不是假装我们已经知道总体标准差。
置信区间量化的是随机抽样造成的不确定性。它不会自动处理下面这些问题:
如果样本估计本身有偏,置信区间只会围着这个偏掉的中心画一段范围。增加样本量后区间甚至会变得更窄,看上去非常精确,却仍然精确地错着。
“区间很窄”只说明随机误差小,不等于研究结论一定可靠。抽样方法、测量质量和研究设计决定中心有没有偏;置信区间主要告诉我们围绕这个中心还会随机摇多大。
样本量非常大时,标准误会很小,于是很微弱的差异也可能被统计方法识别出来。例如一个网站有数百万用户,转化率从 提升到 ,区间可能窄到足以排除“完全没有提升”。
但这 个百分点是否值得重新开发页面,要看新增收益、维护成本、用户体验和风险。统计方法回答的是“差异是否大到不像普通抽样波动”,实际决策还要问“差异是否大到值得在现实中采取行动”。
这一点会直接连接到下一章的显著性检验:统计显著性是证据强度的概念,实际重要性是效果大小和情境价值的概念,两者不能互相替代。
以后遇到一样本或两样本区间问题,可以按下面的顺序检查。
明确总体、未知参数和样本统计量。先说清楚要估计的是一个比例、一个均值、两个参数之差,还是配对差值的均值,不要一上来就套公式。
检查数据从哪里来。对总体参数作置信区间,需要随机抽样、可辩护的随机过程,或至少能说明取样机制为什么足以代表目标总体。随机分派主要用于让处理组可比较并支持因果解释;它本身不会让实验参与者自动代表更大的总体。便利样本的代表性问题也不能靠更复杂的公式补救。
检查抽样分布近似条件。比例看每组成功与失败数;均值看样本量、偏斜和离群值;配对数据则检查差值,并确认不同配对之间近似独立。
选择统计模型。比例常用正态临界值 ;一样本均值和配对均值差使用一样本 t;两独立均值通常使用 Welch t。先判断两组是独立还是配对。
某校随机抽取 名本科生,其中 人每天使用校园公交。请指出总体、参数、样本和统计量。
某学校随机调查 名学生,发现 人每周至少运动三次。检查近似条件,并用 给出总体比例的近似 置信区间。
某次随机调查得到总体支持率的 置信区间为 到 。下面哪种解释正确?
在其他条件不变时,若想把比例置信区间的误差界缩小到原来三分之一,样本量大约要变成原来的多少倍?
某平台随机抽取 名用户,记录他们完成一项任务所需的时间。样本均值为 分钟,样本标准差为 分钟。假设数据没有明显偏斜或离群值,使用 构造总体平均时间的 置信区间。
某批产品随机抽检 件,没有发现不合格品。有人直接使用普通比例近似公式,得到 、标准误为 ,于是宣布“总体不合格率确定为 ”。这一步错在哪里?
某社交平台发起自愿点击投票,收到了 份回答,并报告一个非常窄的 置信区间。这个区间能否保证结果代表全体用户?
到这里,我们已经能用区间回答:“哪些总体参数值和当前样本还算相容?”对两组比较,我们尤其会看差异区间是否包含 。下一章会把问题换一个方向:先提出一个具体说法,例如“两个按钮的真实转化率相同”,也就是 ,再问如果这个说法成立,眼前的样本差异有多反常。
置信区间和显著性检验不是两套互不相干的技巧。它们都在比较观察到的差异和随机抽样本来就会产生的波动。不过检验会把零假设强加的条件放进标准误,例如两比例相等时常使用合并比例。理解了非合并区间标准误、Welch t、配对差值和长期覆盖,下一章的零假设、p 值和统计显著性就不再是突然冒出来的新规则,而是同一条推断逻辑的下一步。
| 样本均值 |
| 全校学生每天的平均屏幕时间 | 总体均值 | 样本均值 |
是这一次样本对 的点估计。它是目前最直接的线索,但不等于已经知道 精确就是 。
| 较宽 |
检查近似条件。民调需要有合理的随机抽样设计。样本中支持人数是 ,不支持人数是 ,两者都远大于 ,所以样本比例的抽样分布可以用正态分布近似。
用样本比例估计标准误:
也就是约 个百分点。
置信水平使用 ,所以误差界为:
用点估计加减误差界:
这次调查给出的合理范围约为 到 。
| 样本很大且 未知 | 仍可用 t 区间 | 此时 t 临界值已经很接近 z 临界值 |
样本均值的估计标准误为:
误差界为:
置信区间是:
根据这次随机样本,生产线总体平均灌装量的合理范围大约是 毫升到 毫升。
差异的点估计为 ,也就是新版高 个百分点。
四个计数分别是 A 组注册 、未注册 ,B 组注册 、未注册 ,都远大于 。再加上两组彼此独立,近似条件合适。
计算差异的非合并标准误:
置信水平下,误差界为:
新版减旧版的比例差区间为:
用百分点说,新版真实转化率相对旧版可能高约 到 个百分点。区间很宽,提醒我们“点估计提高 4 个百分点”仍有明显抽样不确定性。
所以方式 B 的总体完成率估计比方式 A 高约 到 个百分点。这个结论依赖两组的分配或取样方式足以支持比较。
样本里 A 平均比 B 慢 分钟。
计算差异的标准误:
Welch 公式给出自由度约为 。 置信水平下,可用 。
误差界为:
置信区间为:
根据这两组独立样本,方式 A 的总体平均配送用时估计比方式 B 长约 到 分钟。
所以方式 B 的总体平均成绩估计比方式 A 高约 到 分。若学生不是随机取样或两班还有教师、基础水平等系统差异,这个计算不能自动消除那些偏差。
自由度为 , 置信水平下取 。
误差界为:
平均降低量的区间为:
根据这 对测量,训练后的总体平均收缩压估计比训练前低约 到 毫米汞柱。
所以每台机器调整后的总体平均节能量估计约为每小时 到 千瓦时。这个解释依赖这 台机器的取样方式足以代表目标机器总体。
计算点估计、标准误、误差界和区间,并在最后一步保留足够小数,避免中途过早四舍五入。
回到情境解释区间。说明估计的是哪个总体参数、数据对应哪个时间和人群,同时避免把置信水平误说成参数落入固定区间的概率。
是参数 的点估计,不是总体比例的精确已知值。
标准误为:
误差界为:
所以区间约为:
根据这份样本,每周至少运动三次的学生总体比例的合理范围约为 到 。
那么:
所以样本量大约要扩大到原来的 倍,而不是 倍。
误差界为:
区间为:
可以报告为约 分钟到 分钟。这个区间估计的是全部同类用户的总体平均完成时间,不是说 的用户个人时间都在这里。