上一节我们学会了先画图,看分布是对称还是偏斜、数据挤在哪里、尾巴伸向哪边。现在该回答图上最自然的两个问题了:这组数据大致以哪里为中心?它们又散得有多开?
先看 6 个人的年收入,单位是万元:
如果公司只公布“平均年收入约 16.7 万元”,数字当然没有算错。可你若据此想象出 6 个人都拿着十几万元,就被这个平均数带偏了:5 个人集中在 7 到 10 万元,只有 1 个人拿到 58 万元。
这正是描述统计最容易让人放松警惕的地方。一个统计量可以计算完全正确,却没有回答你真正想问的问题。所以我们不会只背“均值等于总和除以个数”,而要弄清每个统计量到底在看数据的哪一部分、会被什么影响,以及什么时候应该换一种说法。

描述一组定量数据时,最好把“形状、中心、离散程度、异常值”连在一起说。中心告诉我们典型位置,离散程度告诉我们这个位置周围有多拥挤;缺了任何一边,数据的故事都可能变形。
平均数、中位数和众数都能描述“中心”,但这个“中心”并不是同一个意思。平均数像把总量重新均分,中位数看排队后的中间位置,众数找最常出现的值或最突出的峰。
设一份样本里有 个观测值 ,样本平均数记作 :
收入数据的总和是 万元,所以:
你可以把平均数想成一次“抹平”。把 6 个人的收入全收进一个池子,再平均发回去,每人会拿到约 16.7 万元。这个解释也说明了平均数的强项:它保留了总量信息。只要知道平均数和人数,就能找回总量:
它也可以看成数轴上的平衡点。低于平均数的点把天平往左拉,高于平均数的点往右拉;离平均数越远,拉力越大。正因为 离其他收入很远,它会明显地把平衡点拖向右边。
如果表里记录的是我们实际观察到的一个样本,平均数用 表示,样本量用 表示。如果我们真的掌握了总体中每一个对象的数值,总体平均数通常写成 ,总体大小写成 :
计算动作几乎一样,身份却不一样。例如抽查 60 名学生得到的平均睡眠时间是 ;全校每名学生的真实平均睡眠时间才是 。现实里总体往往太大、太难完整测量,所以我们常用样本的 去估计未知的 。后面学习统计推断时,这个“用看得见的一部分猜看不见的整体”会成为主线。
“把几个数相加再除以个数”有一个隐藏前提:每个数的分量相同。课程总评里,作业、小测和期末考试通常不等重,此时要算加权平均数:
假设作业占 、小测占 、期末考试占 ,某同学三项成绩分别是 、、。总评不是 ,而是:
这里权重已经加起来等于 ,所以不必再除一次。若权重写成 ,结果仍然相同,但要除以权重之和 。
“把各组平均数再平均”经常会错。一个 10 人小组平均 90 分,另一个 40 人小组平均 70 分,合并平均分不是 80 分,而是用人数加权: 分。只有各组人数相同,平均数的简单平均才成立。
中位数只看位置,所以第一步必须排序。收入已经从小到大排好:
数据有偶数个,中间是第 3 个和第 4 个位置,中位数取这两个值的平均:
如果有 7 个数,中位数就是第 4 个数。它的核心意思是:至少一半数据不高于它,也至少一半数据不低于它。
注意,中位数里的“平均”只是处理偶数个数据时,用两个中间值确定一个切点。它并不会像平均数那样把所有数据都纳入运算。把 改成 ,只要它仍在最右边,中间两个位置就没变,中位数仍是 。
这组收入里 出现两次,其他值只出现一次,所以众数是 。众数还有几个容易漏掉的情况:
在大样本的直方图里,我们还会把明显的高峰称为众数附近。连续数据可能几乎没有完全相同的观测值,此时机械地数“哪个精确值重复最多”反而没有多大意义,观察突出的峰更实用。
如果问题是“6 人的工资总预算平均摊到每人是多少”,平均数正合适。如果问题是“普通成员大致拿多少”,中位数更贴近多数人。如果问题是“最常出现的工资档位”,众数才直接回答。
先做一个小实验。把收入中的 增加到 ,其他 5 人完全不变。总和增加 ,6 人的平均数就增加:
新平均数从约 变成约 ,中位数却仍是 。更一般地说,只改动一个观测值,若它增加了 ,平均数会增加 。这不是平均数“失灵”,而是它忠实地把每一个数值的大小都算进去了。
下面的交互固定 7 位普通收入者,只拖动第 8 位收入者。观察两条中心线:最高收入越来越大时,平均数持续右移,中位数却几乎不动。
中位数对少数极端值不敏感,我们说它具有抗极端值性,或称它是较稳健的统计量。平均数没有这种稳健性,标准差也没有。
但“稳健”绝不是“看见异常值就删掉”。一个特别高的收入可能是真实的管理层收入;一次 分的考试成绩可能是录入错误,因为满分只有 ;医院里异常高的指标也可能正是最需要关注的病人。正确顺序是先查原因:
只有确认是记录或测量错误时,才有依据修正。真实但特殊的数据应该保留,并在解释中说明。
收入、房价和财富常常右偏:多数数据挤在较低区域,少数很大的值形成长长的右尾。平均数会被这些大值拉向右边,通常高于中位数。
左偏分布则相反。例如一份较容易的考试,大多数学生接近满分,少数低分把左尾拖长,平均数常低于中位数。
“平均数和中位数谁大”能给形状提供线索,但不能单独定案。分布可能有多个峰,也可能由不同人群混合而成。最稳妥的做法仍然是先看图,再比较两个中心。
某团队 7 名成员月收入(千元)为:
求平均数、中位数和众数,并判断哪个值更适合描述普通成员。
所有收入相加得到 千元,共 7 人,所以平均数是 千元。
7 个数已经排好序,正中间是第 4 个数,所以中位数是 千元。
最常见的误读是把“平均数为 12.9”翻译成“大多数人大约拿 12.9”。平均数是平衡点,不承诺数据会在它附近出现,更不承诺多数人接近它。
下面两组考试成绩的平均数都是 分:
A 组围在 附近,B 组从 一直铺到 。只报“平均分都是 82”,会把两组最明显的差别抹掉。我们还需要一个量来描述点离中心有多远,这就是离散程度。
极差等于最大值减最小值:
A 组极差是 ,B 组极差是 。它计算快、解释直观,很适合第一眼看跨度。
它的弱点也非常明显:只看两个端点。把 B 组中间三个数改得乱七八糟,只要最小值仍是 、最大值仍是 ,极差就完全不变。反过来,一个录入错误也足以让极差暴涨。
四分位数关注位置,不太受最远端数值影响。把数据从小到大排列后:
到 包住中间约一半数据,这段长度叫四分位距:
IQR 越小,中间一半数据挤得越紧;IQR 越大,中间一半铺得越开。由于它不直接使用两端的具体距离,所以比极差稳健。
不同软件对四分位数可能采用略有差异的插值规则,小数据集上结果偶尔会差一点。本教程手算时统一使用下面的方法:
只要在同一道题里始终使用同一规则,解释就不会自相矛盾。实际分析时如果软件结果和手算差一点,先查它采用了哪一种四分位数定义,不要急着判断谁算错了。
某窗口 11 位顾客的等待时间已经排好,单位是分钟:
一共有 11 个数,正中间是第 6 个数,所以中位数 。
暂时排除中位数。左半边是 ,中间值为 ,所以 。
一组数据的五数概括是:
上面等待时间的五数概括为:
这 5 个数压缩了分布的整体跨度、中间位置和中间一半的跨度。它丢失了很多细节,却给箱线图搭好了骨架。
常用的异常值围栏是:
代入等待时间:
,所以 会被标为高端异常值;,所以 仍在围栏内。
1.5IQR 是筛查规则,不是“错误数据判决书”。落在边界外,只说明这个值相对其余数据很远,值得检查和解释;它完全可能是真实观测。
箱线图的结构可以按下面顺序读:
对等待时间来说,上界是 ,所以右须停在实际观测值 ,不是停在 ; 单独画点。下须停在最小观测值 ,也不是画到理论下界 。
这里有一个常见混淆:五数概括中的最小值和最大值仍然是原始数据的 和 ;但采用 1.5IQR 规则的箱线图,须端可能不是原始最大值或最小值。只要存在异常点,五数概括的两端和箱须端就要分开说。

下面的工作台可以切换成绩、房价和等待时间。工作台里的“等待时间”预设使用的是另一组数据,专门留给你继续练习,不要和刚才的例题混成同一组;点击数据点时,重点核对它处于箱体、须内还是围栏外。
箱线图不是一个“装数据的盒子”,每一段都对应大约四分之一的数据。如果 到中位数这一段很短,说明那四分之一的数据挤得比较密;某一条须很长,说明那一侧的数据拉得比较开。
如果中位数偏向箱子一端,而且另一侧的箱体和须更长,分布可能向较长的一侧偏斜。单独的远点也能提醒我们查异常值。
不过箱线图看不出所有东西。它不会直接告诉你分布有几个峰,也不会显示同一区间内的数据到底怎样堆积;普通箱线图的箱宽还不能自动代表样本量。比较两个分布时,最好把箱线图和点图、直方图或样本量一起看。
极差只看两端,IQR 主要看中间一半。标准差走的是另一条路:它让每个观测值都参与,并描述数据到平均数的典型偏离大小。
每个观测值与平均数的差叫偏差:
低于平均数的偏差为负,高于平均数的偏差为正。平均数恰好是平衡点,所以所有偏差相加一定等于 :
这就是第一个反直觉处:哪怕数据散得很开,直接把带正负号的偏差平均,结果也永远是 。它无法衡量离散,因为左右两边恰好抵消了。
统计学采用偏差平方来解决抵消问题:
平方做了两件事。第一,正负偏差都会变成非负数,不再互相抵消。第二,离均值特别远的点会得到更大的权重:偏差从 变成 时,平方会从 变成 。
绝对值也能消除正负号,确实存在“平均绝对偏差”这样的统计量。方差选择平方,不是因为绝对值毫无道理,而是平方在后续的概率模型、代数分解和推断计算中有一整套非常顺手的性质。代价是它对异常值较敏感。
偏差本来和原数据单位相同,平方后单位也跟着平方。成绩以“分”为单位,方差就成了“平方分”;身高以厘米为单位,方差就是平方厘米。这个单位不容易直观解释。
所以在方差外再开平方,得到标准差,让单位回到原来的尺度:
标准差可以粗略理解成“观测值离平均数通常有多远”。它不是所有距离的普通平均,也不保证每个点都落在一个标准差以内,但它给出了一个可比较的典型尺度。
如果手里是整个总体,共有 个值,总体均值、方差和标准差分别写成 、 和 :
这里除以 ,因为总体里的每个对象都已经被观察到,我们只是在描述它们本身。
如果数据只是从更大总体抽出的样本,样本方差和样本标准差写成 和 :
为什么不是除以 ?先抓住两个直觉。
第一, 是用这份样本自己算出来的,它天生比未知的总体均值 更贴近这批样本。若直接围绕 计算并除以 ,长期来看会把总体的离散程度估得偏小。
第二,一旦前 个偏差确定,最后一个偏差就被“偏差和必须为 0”强行确定了,真正能自由变化的只有 个。我们说这时有 个自由度。除以 相当于补偿样本均值带来的低估。
只描述手头这几个数本身时,有些软件会提供除以 的总体标准差;把它们当作样本去估计更大总体时,统计课程通常使用除以 的样本标准差。算之前先确认题目把数据当总体还是样本,不要只看计算器按键。
回到 A、B 两组成绩。我们把它们看成从更大范围抽出的样本,因此使用样本标准差。
A 组平均数是 。偏差为 ,平方后为 ,平方和为 。
标准差的单位与原数据相同:成绩标准差是“分”,等待时间标准差是“分钟”,收入标准差是“万元”。方差的单位则是原单位的平方。
标准差大不自动等于“数据差”,标准差小也不自动等于“数据好”。生产误差的标准差小通常意味着稳定;学生成绩的标准差小,可能是水平接近,也可能只是试题太容易、大家都接近满分。统计量给出结构,评价仍要回到问题。
还有一个常见误区:不能对所有分布都硬套“约多少数据在一个标准差以内”。这个比例取决于分布形状。接近钟形的分布有后面会学到的经验规律,明显偏斜、多峰或有异常值时,先看图比背比例可靠。
原始分数常常不能直接跨尺度比较。甲考试平均分 、标准差 ,某同学得 ;乙考试平均分 、标准差 ,另一位同学得 。谁在各自考试中的相对位置更靠前?
z 分数把“高出平均数多少”除以标准差,换成统一尺度。若均值和标准差来自总体:
若是在一份样本中描述某个观测值,也常写成:
甲考试的相对位置是:
乙考试的相对位置是:
所以甲考试中的 分位于平均数上方 个标准差,乙考试中的 分位于平均数上方 个标准差。按各自考试的离散尺度看,前者相对位置更高。

如果一个学生的 ,意思是他的成绩比平均数低 个标准差,不是“成绩为负”,也不是“答错了 1.5 道题”。z 分数没有原始单位,它描述的是相对位置。
z 分数适合比较不同量表下的相对位置,也能帮助发现离中心很远的观测值。但它不会凭空告诉你百分位数。相同的 放在钟形分布、右偏分布和双峰分布里,对应的实际稀有程度可能不同。
它还继承了均值和标准差对异常值的敏感性。如果分布强烈偏斜,均值和标准差本身已经被长尾拉动,z 分数的直觉也要谨慎解释。先看分布形状,再谈“这个 z 很不寻常”,会更稳。
中心和离散应该成对选择,因为每一对看待数据的方式一致:
这不是死规定。如果你研究的是极端损失,异常值本身就是重点,即使分布右偏也可能必须同时报告平均损失;如果要描述普通家庭的住房成本,中位数和 IQR 通常更贴近主体。
一个完整的报告常会把两套都列出来,再根据问题解释哪一套更有代表性。真正要避免的是只挑一个“看起来最好看”的数字。
前面的 A、B 两组成绩都有平均数 ,但样本标准差分别约为 和 。中心相同不代表表现相似;B 组内部差异明显更大。
再看两组以 为中心的数据:
两组平均数都为 。相对平均数的偏差平方和也都为 ,所以样本标准差完全相同:
可形状明显不同。C 组左右对称、逐级铺开;D 组有 4 个值堆在 ,左侧还有一个较远的 。D 组中位数是 ,众数也是 ,C 组中位数是 且没有重复值。
这说明均值和标准差再有用,也只是压缩后的摘要。两个摘要完全相同,原始分布仍可能长得不一样。图形、中心、离散和异常值要互相补充,不能彼此替代。
拿到一组数据时,可以按这个顺序描述:先看图并说形状;再选中心和离散;随后指出异常值;最后把统计量放回单位和情境。计算是中间步骤,不是结论本身。
某小组 8 人年收入(万元)是:
求平均数、中位数、众数。若要描述多数成员的大致收入,你会选哪个?如果把 改成 ,哪个中心会变,怎么变?
一门课的平时作业、小测和期末考试权重分别是 、、。某同学三项成绩为 、、。总评是多少?为什么不能直接除以 3?
一组配送时长(分钟)为:
按本节分半规则求 、中位数、 和 ,再判断 是否为高端异常值,并说明上须应停在哪里。
数据 的平均数是 ,偏差平方和是 。若这 3 个数就是整个总体,标准差是多少?若它们只是样本,样本标准差是多少?
某次语文考试平均分 、标准差 ,小林得 ;数学考试平均分 、标准差 ,小周得 。谁在各自考试中的相对位置更高?
某城市住房成交价明显右偏,并有少数千万级豪宅。若要描述普通购房者面对的典型价格和中间一半房价的跨度,应该选哪一对统计量?若要估算 1000 套房的总成交金额,又更依赖哪个中心?
如果两组数据的平均数和标准差都相同,能否断定它们的直方图、众数和异常值情况也相同?
这一节始终在描述一个变量:一组收入、一次考试成绩、一批等待时间。我们用平均数、中位数和众数找中心,用极差、IQR 和标准差看离散,再用 z 分数描述单个观测的相对位置。
下一步自然会出现一个新问题:如果同时记录两个变量,它们会不会一起变化?例如学习时间较长的人,成绩通常是否也较高?温度升高时,冰淇淋销量和水边救援记录为什么都会增加?这时单变量的中心和离散不够了,我们要把两个变量放进散点图,讨论相关方向和强弱,还要警惕一个更容易误导人的跳跃:相关并不等于因果。
和 都出现两次,而且并列最多,所以有两个众数: 千元和 千元。
问题要描述普通成员,而 千元远离其余 6 人。中位数 千元更接近主体;平均数 千元更适合需要保留总工资信息的预算问题。
右半边是 ,中间值为 ,所以 。
四分位距是 分钟。这意味着中间一半顾客的等待时间主要横跨 18 到 29 分钟。
A 组样本方差为 ,样本标准差为 分。
B 组平均数也是 。偏差为 ,平方后为 ,平方和为 。
B 组样本方差为 ,样本标准差为 分。
两组中心相同,但 B 组的标准差约为 A 组的 3.5 倍。只报平均分会掩盖这种稳定性差异。
上界为:
,所以它按规则被标为高端异常值。上须不画到理论边界 ,而应停在边界内最大的实际观测值 。
把它们当样本时除以 :
两个答案不同不是计算矛盾,而是数据身份不同。总体标准差只描述这 3 个值;样本标准差还承担估计更大总体离散程度的任务。
小周的原始分数更低,但他高出本次数学考试平均数 2 个标准差;小林高出语文平均数 1.5 个标准差。因此按各自考试的尺度,小周的相对位置更高。