随机变量与常见分布
上一节里,我们一直在谈事件:阳性、下雨、点击、迟到。事件很适合回答“会不会发生”,可一旦问题变成“会发生几次”“要等多久”“损失会有多大”,只用事件就有点吃力了。
随机变量就是从这里登场的。它把随机结果翻译成数,再用一套分布说明这些数各有多大可能。这样一来,前面学过的概率规则就能继续向前走:我们不只会算一件事发生的概率,还能讨论长期平均、风险大小和极端结果。
这部分最容易产生两个错觉。第一个是把随机变量理解成“一个自己乱跳的字母”;第二个是见到钟形曲线或成功次数,就急着给数据贴上某个分布的标签。我们会把这两件事拆开讲清楚:随机变量是一条从结果到数值的规则,分布是一种有条件的概率模型。
随机变量:先把结果翻译成数
设一次随机试验所有可能的结果组成样本空间 S,其中一个具体结果记作 ω。随机变量 X 给每个结果安排一个实数:
X:S→R
这个写法看着很正式,意思却很朴素:把结果送进一条规则,出来一个数 X(ω)。前面讨论样本空间时也用了 S;有些书把它写成希腊字母 Ω,两种写法只是在给同一个对象取不同名字。
比如连续抛两次硬币,样本空间可以写成:
S={正正,正反,反正,反反}
如果我们关心“正面出现几次”,就定义 X 为正面次数。于是:
注意“正反”和“反正”是两个不同结果,却被映射成同一个数 1。随机变量并不需要保留结果的全部细节,它只保留当前问题关心的那一部分。如果我们改为关心“第一次是不是正面”,就会得到另一条映射规则,也就是另一个随机变量。

随机变量不是试验结果本身。邮件“被点击”是一个结果,把被点击记为 1、未点击记为 0,得到的数值规则才是随机变量。先说清楚映射规则,后面的均值、方差和分布才有明确含义。
离散还是连续
随机变量通常先分成两类:
“记录时有没有小数”不是判断标准。一家门店把等待时间四舍五入成整数分钟,数据表里虽然只有整数,但等待时间背后的量仍然是连续的;相反,一场比赛的得分即使写成 3.0,它依旧是在数离散的得分。
离散分布:给每个可能值分配概率
设离散随机变量 X 的可能取值为 x1,x2,…。它的概率质量函数写作:
pX(x)=P(X=x)
它必须满足两条底线:每个概率都不能为负,所有可能取值的概率加起来等于 1。
pX(x)≥0
x∑pX(x)=1
假设一台设备一天内的故障次数 X 有下面这个简化分布:
这张表已经把离散分布说完整了。比如:
P(X=1)=0.30
而“一天至少故障一次”需要把 1、2、3 三种互斥情况加起来:
P(X≥1)=0.30+0.10+0.05=0.45
也可以用补集更快地算:
P(X≥1)=1−P(X=0)=1−0.55=0.45
累积分布函数:把左边的概率不断累加
概率质量函数逐点回答“恰好等于多少”。还有一种更通用的记法叫累积分布函数:
FX(x)=P(X≤x)
它回答“落在 x 左边、包括 x 的概率有多少”。在刚才的故障例子里:
FX(1)=P(X≤1)=0.55+0.30=0.85
随着 x 从左向右移动,累计进去的概率只会增加,不会减少。对离散变量,FX(x) 常像一段一段向上跳的台阶;到最右边时,它最终接近 1。
入门阶段不用急着研究累积分布函数的全部性质。先记住它是一种“从最左边累加到当前位置”的记账方式,而且离散分布和连续分布都能用它描述。
连续分布:概率藏在区间面积里
连续随机变量不能再给每个可能值单独列一行,因为两个数之间永远还可以插入更多数。我们改用概率密度函数 f(x) 描述概率怎样铺在数轴上。

一个合法的密度函数满足:
f(x)≥0
∫−∞∞f(x)dx=1
落在区间 [a,b] 的概率,是密度曲线在这段区间下方的面积:
P(a≤X≤b)=∫abf(x)dx
这里最反直觉的一点是:曲线高度不是概率,面积才是概率。 密度可以大于 1,只要整条曲线下的总面积仍然等于 1。
为什么连续变量的单点概率是 0
设 X 是精确测量的等候时间。问 P(X=12),其实是在问时间是否刚好等于 12.000000……分钟,不多也不少。在连续模型里,一个点没有宽度,曲线下也就没有面积,因此:
P(X=12)=0
这不表示“12 分钟不可能出现”。它表示精确到无限小数时,任何一个孤立点都不占概率。现实中看到“等待时间为 12 分钟”,通常是因为计时器做了取整。若记录精确到分钟,显示为 12 的实际范围可能是 11.5≤X<12.5,这是一个有宽度的区间,当然可以有正概率。
连续分布还有一个方便结果:端点本身不占面积,所以小于还是小于等于通常没有区别。
P(a<X<b)=P(a≤X≤b)
不要把“密度最高的点”读成“这个点发生的概率最大”。连续变量的每个单点概率都是 0。密度高只说明这个点附近的一个小区间更容易积累出较大的概率。
连续情形下的累积分布
累积分布函数仍然定义为:
FX(x)=P(X≤x)
如果 X 有密度 f,那么它就是从最左边一直积到 x 的面积:
FX(x)=∫−∞xf(t)dt
因此区间概率也可以写成:
P(a<X≤b)=FX(b)−FX
你可以把 f 理解成“概率在当前位置铺得有多密”,把 F 理解成“走到当前位置一共收集了多少概率”。
期望:不是下一次预测,而是长期平均
对离散随机变量,期望是所有可能值按概率加权后的平均:
E(X)=x∑xP(X=x)
“加权”很重要。常见结果出现得多,对平均的影响就大;罕见结果出现得少,但如果数值特别大,也可能明显拉动期望。
例题:这个转盘游戏值不值得玩
一个游戏每次先付 10 元。转盘给出的奖金有三种:一半概率没有奖金,三成概率得到 20 元,两成概率得到 50 元。设 R 表示奖金,X 表示扣掉报名费后的净收益。
先把奖金分布写清楚。R 的可能值是 0、20、50,对应概率分别为 0.5、0.3、0.2。这三个概率相加等于 1,所以构成完整分布。
计算平均奖金:
E(R)=0
这个游戏的期望为正,不代表每次都赚钱。你有 50% 的概率当场亏 10 元。若只能玩一次,是否参加还取决于你能不能承受损失;若能独立重复很多次,长期平均才更有机会接近期望。
期望的线性性质
如果 a,b,c 是常数,那么:
E(aX+bY+c)=aE(X)+bE(Y)+c
这条性质不要求 X 和 Y 独立。期望只管长期中心,变量之间是否有关联不会破坏“总和的平均等于平均的总和”。
例如,平台预计上午订单收益为 X,下午订单收益为 Y,全天还要固定支付 500 元场地费。即使上午和下午会同时受到天气影响,全天净收益的期望仍然是:
E(X+Y−500)=E(X)+E(Y)−500
处理“总次数”“总花费”“总收益”时,先试着把目标写成几个随机变量的和。期望可以逐项相加,而且不需要独立性。这往往比先求总量的完整分布省事得多。
方差与标准差:同样的平均,风险可能完全不同
期望只告诉我们中心,不告诉我们结果会围绕中心晃多远。方差把每个结果到均值的距离平方,再按概率平均:
Var(X)=E[(X−μ)2]
其中:
μ=E(X)
对离散变量,也可以展开成:
Var(X)=x∑(x−μ)2P(X=x)
计算时常用等价公式:
Var(X)=E(X2)−[E(X)]2
标准差是方差的平方根:
SD(X)=σ=Var(X)
为什么要平方?如果只把偏差 X−μ 直接平均,正偏差和负偏差会互相抵消,结果永远回到 0。平方让两边的偏离都变成正数,也让特别远的结果受到更大权重。
方差的单位是原单位的平方。若 X 用元计,方差用平方元计,不太好直接解释;标准差开方后回到元,所以现实交流里更常说标准差。
继续看转盘游戏的风险
刚才净收益 X 的可能值为 −10、10、40,概率分别为 0.5、0.3、0.2,而且 E(X)=6。先算平方的期望:
E(X2)=(−10)2×0.5+102
所以:
Var(X)=400−62=364
SD(X)=364≈19.08
平均每局净赚 6 元,标准差却约为 19.08 元,说明单局结果离 6 元很远并不稀奇。期望描述“长期中心”,标准差补上“单次结果通常会摇多大”。做保险定价、库存准备和资金管理时,这两项经常要一起看。
平移和缩放会怎样改变波动
给每个结果都加上同一个常数,只会整体平移,不会改变分散程度:
Var(X+c)=Var(X)
把每个结果放大 a 倍,离均值的距离也放大 ∣a∣ 倍,所以方差会放大 a2 倍:
Var(aX)=a2Var(X)
两个随机变量相加时,一般公式还要包含协方差:
Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)
其中:
Cov(X,Y)=E[(X−E(X))(Y−E(Y))]
协方差为正,表示两者倾向于一起高于或一起低于各自均值,合计波动会被放大;协方差为负时,一个偏高常伴随另一个偏低,合计波动会被抵消。只要 Cov(X,Y)=0,方差就可以直接相加。
独立是协方差为 0 的常见充分条件,但不是必要条件:两个变量可能不独立,协方差仍然恰好为 0。所以准确的说法是“协方差为 0 时可以相加”;独立只是最容易确认这种情况的一种条件。这一点和期望的线性性质不同,期望相加从来不要求独立。
伯努利分布:一次试验,只有两类结果
一次试验只有“事件发生”和“事件不发生”两类结果时,可以把发生记为 1,不发生记为 0。若事件发生的概率是 p,就写成:
X∼Bernoulli(p)
它的概率质量函数是:
P(X=1)=p
P(X=0)=1−p
期望和方差分别为:
E(X)=p
Var(X)=p(1−p)
这里的“成功”只是我们给事件起的技术名称,不带褒贬。研究设备故障时,可以把“故障”记为成功;研究贷款违约时,也可以把“违约”记为成功。关键是从头到尾保持定义一致。
伯努利变量还有一个很好用的直觉:因为它只取 0 和 1,重复很多次后的平均值就是 1 所占的比例。所以 E(X)=p 同时连接了“概率”和“长期频率”。
二项分布:固定次数里出现多少次成功
现在把同一种伯努利试验重复 n 次,用 X 记录成功总次数。如果以下四个条件成立,X 服从二项分布:
- 试验次数 n 事先固定。
- 每次结果都能归为成功或失败两类。
- 每次成功概率都相同,记为 p。
- 各次试验相互独立。

记作:
X∼Bin(n,p)
刚好出现 k 次成功的概率是:
P(X=k)=(kn)pk(1−p
其中:
(kn)=k!(n−k)!n!
这个公式不是凭空出现的。pk(1−p)n−k 是某一种固定排列发生的概率,例如“成功成功失败成功失败”;(kn 负责数清楚成功可以放在哪 个位置。两部分相乘,才覆盖“恰好成功 次”的全部排列。
例题:抽检中发现缺陷件
某生产过程下,每件零件出现缺陷的概率为 0.02。质检员从当天大量、稳定生产的零件中随机抽取 20 件,并把各件是否有缺陷近似看成独立。设 X 表示缺陷件数。
先定义成功。这里把“抽到缺陷件”记为成功。每件只有缺陷和无缺陷两类结果,成功概率为 p=0.02。
再检查结构。抽检数固定为 n=20;题目假设生产过程稳定,所以每件缺陷概率近似相同;抽样来自大量产品,各次结果可以近似看成独立。因此可以用二项模型:
二项模型什么时候会失效
看到“成功次数”还不够,四个条件必须逐项检查。
- 从只有 30 件、其中确定有 3 件缺陷的批次里不放回抽 20 件,每抽一次都会改变剩余组成,独立性和相同概率都不成立。
- 观察 30 天内每天是否下雨,如果进入雨季后降雨概率不断上升,p 不是固定的。
- 统计宿舍里感染人数时,一个人的感染会改变室友的风险,各次结果可能明显相关。
- 一直试到第一次成功才停止,试验次数没有预先固定,随机变量也不是固定次数内的成功个数。
样本来自一个很大的总体且抽样比例很小时,不放回带来的依赖有时可以忽略,二项分布可以当近似。这里要说的是“近似合理”,不能把依赖关系说成真的消失了。
二项之外:问题稍微一变,模型也要跟着变
二项分布只回答一种结构很固定的问题:预先做 n 次相互独立、成功概率相同的两类试验,最后数成功次数。现实问题往往只改动其中一个条件,答案就会落到另一个常见模型上。
下面用一家设备维修中心贯穿四种变化。中心既要抽检备件,也要反复尝试远程修复,还要安排故障工单的接线人手。看起来都是“成功、故障和等待”,但随机变量问的东西不同。
超几何分布:有限总体中不放回抽样
维修中心收到一箱 N 个备件,其中已知有 K 个不合格。质检员不放回抽取 n 个,设 X 为样本中的不合格件数。抽走一件以后,箱中剩余组成会改变,所以各次抽取不独立,不能直接用二项分布。
这时使用超几何分布:
X∼Hypergeom(N,K,n)
恰好抽到 k 个不合格件的概率是:
P(X=k)=(nN)
分母是在 N 个备件中选出 n 个的全部方法。分子先从 K 个不合格件中选 k 个,再从 N−K 个合格件中选剩余的 n−k 个。它的均值是:
E(X)=nNK
这个均值和成功概率取 K/N 的二项模型一样,但完整分布不同。抽样比例越大,不放回造成的影响越明显。
几何分布:一直试到第一次成功
工程师不断尝试同一种远程修复,每次成功概率为 p,各次结果独立,而且失败后成功概率不变。设 T 为包括成功那次在内,直到第一次成功一共尝试了多少次。那么 T 的可能值是 1,2,3,…,并服从几何分布:
T∼Geom(p)
第一次成功出现在第 t 次,意味着前 t−1 次全部失败,第 t 次成功,所以:
P(T=t)=(1−p)t−1p
它的期望是:
E(T)=p1
有些资料把几何变量定义成“第一次成功前失败了几次”,这时取值从 0 开始,公式中的指数和均值会相应平移。两种约定都可以,做题前必须先看随机变量到底数“总尝试次数”还是“失败次数”。
泊松分布:固定区间内出现多少次稀有事件
现在不再固定尝试次数,而是固定观察区间。设 Y 为维修中心一小时内收到的紧急故障工单数。若事件在很小时间段内发生的机会大致与区间长度成正比,不同时段的增量近似独立,而且平均速率在这一小时内稳定,就可以考虑泊松分布。
若一小时平均收到 λ 个工单,记作:
Y∼Pois(λ)
恰好收到 k 个工单的概率是:
P(Y=k)=e−λk!λ
泊松分布有一个醒目的性质:均值和方差都等于参数 λ。
E(Y)=λ
Var(Y)=λ
如果工单会成批涌入、早晚高峰速率差异很大,或一个故障会触发一串相关工单,简单泊松模型就可能低估波动。此时不能只拿“每小时平均几个”硬套公式。
指数分布:泊松过程中要等多久
泊松分布数的是固定区间里的事件个数;指数分布问的是同一类过程中的等待时间。若紧急工单按速率 λ 的泊松过程到达,设 W 为等到下一张工单的时间,那么:
W∼Exp(λ)
它的密度为:
f(w)={λe−λw,0,
等待超过 w 的概率有一个很简洁的形式:
P(W>w)=e−λw
平均等待时间是速率的倒数:
E(W)=λ1
指数分布还有“无记忆性”。已经等了 s 时间仍没等到事件后,再等超过 t 的概率,和刚开始时等超过 t 的概率相同:
P(W>s+t∣W>s)=P(W>t)
直觉上,这表示过去空等了多久,不会让下一小段时间的到达速率改变。它适合速率稳定、没有老化效应的理想过程;人的等待耐心、会磨损的机器寿命通常会随时间改变风险,并不天然具有无记忆性。
例题:同一家维修中心,四个问题用四个模型
维修中心有 20 个备用传感器,其中 4 个不合格;工程师每次远程修复成功率为 0.25;紧急工单平均每小时到达 3 张,并暂时用稳定泊松过程描述。
从 20 个传感器中不放回抽 5 个,恰好发现 1 个不合格,属于超几何问题。这里 N=20、K=4、n=5、:
把这四个问题并排看,模型选择就不容易混:已知有限总体、固定抽样量且不放回,用超几何;重复独立尝试直到第一次成功,用几何;固定时间或空间里数事件,用泊松;在同一个泊松过程中等下一次事件,用指数。
二项分布的正态近似
当 n 较大,而且成功与失败的期望次数都不太小时,二项分布的柱形图会逐渐接近钟形。常用检查是:
np≥10
n(1−p)≥10
这时可以用均值 np、标准差 np(1−p) 的正态分布近似大段区间概率。但二项变量只能取整数,正态变量是连续的;计算很窄的区间时,近似误差可能明显,通常还要做连续性修正。若 p 很接近 0 或 1、样本量又不够大,分布会偏斜,别急着套正态曲线。
均匀分布:等长区间拥有相同概率
设活动开始时刻在 a 到 b 之间随机选择,并且没有哪个时段更受偏爱。若 X 表示开始时刻,就可以用连续均匀分布:
X∼U(a,b)
它的密度是一个平顶矩形:
f(x)=⎩⎨⎧
区间概率只由长度决定。若活动会在 10:00 到 10:30 之间均匀随机开始,那么它在 10:20 到 10:27 之间开始的概率是:
P(20≤X≤27)=30−027−20=
这时 10:00 到 10:05 和 10:20 到 10:25 长度相同,所以概率相同。单个时刻仍然没有面积,P(X=20)=0。
均匀分布的期望和方差是:
E(X)=2a+b
Var(X)=12(b−a)2
只知道最小值和最大值,不能推出均匀分布。现实中的等待时间常常短等待多、长等待少;顾客到店时刻也可能集中在午休前后。均匀模型需要“等长区间同样可能”的机制或数据支持。
正态分布:用均值和标准差定位一条钟形曲线
正态分布是一类连续分布。它关于均值对称,只有一个峰,离中心越远,密度通常越低。若 X 的均值是 μ、方差是 σ2,本课程记作:
X∼N(μ,σ2)
它的密度函数是:
f(x)=σ2π
μ 决定曲线中心。改变 μ,整条曲线左右平移;σ 决定展开程度,σ 越大,曲线越宽越扁。曲线下总面积永远是 1。
正态模型常用来近似许多小影响叠加后的连续测量,例如稳定生产条件下的尺寸误差,或同类对象中由许多因素共同造成的生理测量差异。但“常用”不等于“所有数据都正态”,更不等于现实数据会精确贴着一条理论曲线。
标准化:把不同量纲放到同一把尺子上
正态分布的中心和尺度可以各不相同。为了统一计算,我们把观测值 x 转成标准分数:
z=σx−μ
z 的含义是“这个值离均值有多少个标准差”。正数表示高于均值,负数表示低于均值,z=0 就在均值上。
标准化后的随机变量:
Z=σX−μ
服从标准正态分布:
Z∼N(0,1)
例题:哪个测量结果更异常
某灌装线的瓶装量近似服从正态分布,均值为 500 毫升,标准差为 6 毫升。另一条袋装线的净含量均值为 1000 克,标准差为 10 克。现在测到一瓶 488 毫升、一袋 976 克。不能直接比较“少了 12”和“少了 24”,因为单位和正常波动不同。
瓶装量的标准分数为:
z1=6488−500
68-95-99.7 经验规则
对正态分布,可以快速记住三段中心面积:

- 约 68% 的结果落在 μ±σ 内。
- 约 95% 的结果落在 μ±2σ 内。
- 约 99.7% 的结果落在 内。
因为正态曲线左右对称,均值两侧会平分剩余面积。比如约 95% 落在两个标准差以内,那么落在均值上方两个标准差之外的右尾面积约为:
21−0.95=0.025
回到瓶装线,488 毫升正好是均值下方 2 个标准差。用经验规则估计,低于 488 毫升的比例约为 2.5%。精确计算会略有差异,因为 95% 本来就是便于心算的近似值。
正态模型什么时候不合适
用正态模型前,至少看三件事:形状是否大致单峰对称,变量是否允许在均值两边自然波动,尾部是否和钟形曲线相称。
- 收入、网页停留时长和排队时间常常右偏,极少数大值会拖出长尾。
- 比例被限制在 0 到 1,考试分数也常有上下界;当数据挤在边界附近时,对称正态模型会把一部分概率放到不可能区域。
- 两类人群混在一起,可能出现两个峰,一条钟形曲线会掩盖分组差异。
- 少量极端异常值会让均值和标准差失去代表性,尾部风险也可能被低估。
“看起来有点像钟”只能算初步线索,不能自动证明正态。分布模型是带条件的近似:它帮助我们压缩现实、计算概率,但不会把现实变成教科书里的完美曲线。
选择分布时,先问随机机制
本章出现的常见模型可以先这样区分:
真正的顺序应该是:先定义随机变量,再判断离散或连续,然后看结果是怎样产生的,最后才选模型和公式。若条件只近似成立,就把结论说成近似;若关键条件明显失败,就换模型或回到原始数据本身。
一个现实风险判断
假设医院为急诊到院时间安排人手。历史平均等待是 28 分钟,标准差是 12 分钟。有人因此直接套正态分布,估计“超过 52 分钟”的概率。
先别算。等待时间不能小于 0,而且高峰拥堵可能产生很长的右尾;平均数附近也未必左右对称。若原始分布明显右偏,正态模型可能低估长等待风险。更稳妥的做法是先看直方图、分位数和分时段数据,再决定用什么模型。分布选择本身就是结论的一部分,不能藏在公式后面。
练习
练习 1:写出随机变量映射
连续抛三次硬币。设 X 表示正面次数。
- 写出 X 的所有可能取值。
- “正反正”和“反正正”是否是同一个随机结果?它们的 X 值是否相同?
- X 是离散变量还是连续变量?
X 的可能取值是 0、1、2、3。“正反正”和“反正正”是两个不同的结果,因为出现顺序不同;但它们都含有两个正面,所以都被映射为 X=2。X 数的是正面个数,只能取分开的整数,因此是离散随机变量。
练习 2:检查概率质量函数
有人为随机变量 X 写出下面的分布:
它是合法的概率分布吗?
不是。三个概率虽然都非负,但总和是:
0.25+0.50+0.30=1.05总概率超过了 1,所以至少有一个数写错了。
练习 3:密度与单点概率
公交车会在 8:00 到 8:20 之间均匀到站。设 X 为 8:00 之后经过的分钟数。
- 求公交车在 8:05 到 8:11 之间到站的概率。
- 在连续模型下,求它恰好在 8:11:00 到站的概率。
- 为什么手机上显示“8:11 到站”仍然可能发生?
均匀分布的区间概率等于长度之比,所以:
P(5≤X≤11)=2011−5=0.30精确到一个时间点时,。手机显示到分钟时通常做了舍入,它把一小段真实时间都显示成 8:11;显示值对应的是一个区间,不是数学上的单点。
练习 4:游戏的期望与风险
一个免费游戏有 0.8 的概率获得 2 元,有 0.2 的概率损失 8 元。设净收益为 X。求 E(X),并判断“期望为 0”是否意味着这局不会亏钱。
E(X)=2×0.8+(−8)×0.2=0期望为 0 表示长期平均净收益为 0,不表示单局结果为 0。单局仍有 20% 的概率损失 8 元,也有 80% 的概率得到 2 元。
练习 5:利用期望的线性性质
一家店每天上午利润 X 的期望是 1800 元,下午利润 Y 的期望是 1200 元,每天固定成本为 900 元。上午和下午利润会同时受天气影响。求全天净利润 X+Y−900 的期望,并说明是否需要假设 X、Y 独立。
E(X+Y−900)=1800+1200−900=2100不需要独立。期望的线性性质对有关联的随机变量同样成立。若要计算全天利润的方差,则必须把协方差项算进去;只有协方差为 0 时才能直接相加,独立是保证协方差为 0 的常见充分条件。
练习 6:二项分布条件与计算
某题库中,一名准备充分的学生独立回答每道判断题,答对概率为 0.8。一份小测固定有 10 道题。设 X 为答对题数。
- 说明为什么可以用二项分布。
- 写出恰好答对 8 题的概率。
- 求 E(X) 和 Var(X)。
题目数固定为 10;每题只有答对或答错;每题答对概率相同为 0.8;题目还明确假设各题结果独立。因此:
X∼Bin(10,0.8)P(X=8)=(
练习 7:识别二项模型的误用
盒中有 6 个红球、4 个蓝球,不放回抽取 5 个,记录红球数。能否直接使用 Bin(5,0.6)?应该换成什么模型?并求恰好抽到 3 个红球的概率。
不能直接使用。第一次抽到红球后,剩余红球比例会下降;第一次抽到蓝球后,剩余红球比例会上升。各次抽取不独立,成功概率也不保持 0.6。
总体大小 N=10,其中红球数 K=6,不放回抽样量 n=5,所以使用超几何分布。恰好 3 个红球时:
练习 8:在几何、泊松和指数之间选择
某维修中心的远程修复每次独立成功,成功概率为 0.2。紧急工单暂时可看成每小时平均到达 4 张的稳定泊松过程。
- 设 T 为第一次修复成功所需的总尝试次数,T 服从什么分布?求 P(T>3)。
- 设 Y 为两小时内的紧急工单数,Y 服从什么分布?参数是多少?
- 设 W 为等到下一张紧急工单的小时数, 服从什么分布?求平均等待时间和 。
T 数的是直到首次成功的尝试次数,所以服从参数 p=0.2 的几何分布。T>3 表示前三次都失败:
P(T>3)=
练习 9:标准化与经验规则
某种测量误差近似服从正态分布,均值为 0,标准差为 2 毫米。
- 误差为 3 毫米时,z 分数是多少?
- 约有多少比例的误差落在 −4 到 4 毫米之间?
- 约有多少比例高于 4 毫米?
z=23−0=1.5−4 到 4 毫米对应均值左右 2 个标准差。按 68-95-99.7 经验规则,约 95% 落在这个区间内。区间外共约 ,正态曲线左右对称,所以高于 4 毫米的右尾约占:
练习 10:模型不是标签
某平台用户停留时长的均值为 12 分钟,标准差为 9 分钟。有人据此写下 X∼N(12,81)。只凭这两个数字,为什么还不能接受这个模型?
均值和标准差只能在“已经决定使用正态模型”后确定曲线的位置和宽度,不能证明数据是正态的。停留时长不能为负,通常还有明显右尾,少数用户可能停留很久。还需要查看分布形状、分组和尾部,再判断正态近似是否合理。
从个体分布走向抽样分布
到这里,我们描述的还是“一次结果”或“固定次数里的成功个数”:一次等待多久,一组抽检有几件缺陷,一个测量值离均值多远。
下一步会把视角抬高一层。假设我们从同一个总体反复抽样,每次都算一个样本均值或样本比例,这些统计量本身也会随机变化,也有自己的分布。理解期望、方差、二项分布和正态分布之后,我们就能解释样本结果为什么会摇晃、样本量为什么会改变误差,并最终进入置信区间和统计推断。