一份成绩表里有 40 个分数。你当然可以从第一行看到最后一行,可看完之后,脑子里往往还是一团数字:这个班的典型水平在哪里?大多数人挤得紧不紧?那两个特别低的分数是录入错误,还是确实发生了什么?
统计要做的事,就是把这些问题拆开。先弄清数据从谁身上来,再用几个数和几张图压缩信息,最后判断眼前的规律到底可信到什么程度。
这里有个贯穿全章的习惯:先问数据怎么来的,再问公式怎么算。 一个平均数可以算得一位小数都不差,但如果样本只来自愿意回答的人,它仍然可能离真实情况很远。
假设学校想了解“全校高一学生每天的课外阅读时间”,随机抽了 120 名高一学生填写一周阅读记录。
这句话里藏着四个容易混淆的角色:
总体不一定是“所有人”。如果问题只关心高一学生,那么高二、高三学生就不在总体里。样本也不等于随手能找到的那群人,它应该尽量代表总体。
从总体得到的真值叫参数。例如全校高一学生的平均阅读时间,可以记成 。由样本算出的量叫统计量,例如 120 名学生的样本平均数 。实际研究里,我们常常看不到参数,只能用统计量去估计它。
辨认这四个角色时,先抓动词。题目“想了解”的对象是总体,“实际记录”的对象是样本,“每一行”对应个体,“记录了什么”就是变量。
变量先分成两大类。
定性变量记录类别。例如交通方式、血型、选修课程、是否完成作业。类别可以用数字编码,但编码不等于数值。把“公交”记成 1、“步行”记成 2,并不表示步行是公交的两倍。
定量变量记录可以计算的数量。它还可以再分:
这个区分会直接影响后面选图和选代表值。最喜欢的颜色没有平均数,运动项目也不能算标准差;身高和用时则可以。
常见的数据表遵循一个简单结构:一行对应一个个体,一列对应一个变量。比如记录 5 名学生的睡眠和数学成绩:
“学生”是个体标识,“年级”在这张小表里虽然写成数字,实际更接近有顺序的类别;睡眠时长和成绩是定量变量。后面画散点图时,每名学生贡献一个点,不能把睡眠来自 A、成绩却来自 B 的数据拼成一对。
真实数据很少像练习册那样整齐。空白单元格、重复记录、单位混用和录入错误都很常见。
拿到数据后,可以按这个顺序过一遍:
异常值不等于错误。某次配送用了 82 分钟,可能是输入时多按了一个 8,也可能是暴雨和道路封闭造成的真实延误。统计图只能提醒你“这里与大多数值不一样”,最终还要回到情境核查。
对 个数据 ,算术平均数是
它最直观的解释是“先汇总,再均分”。如果 5 名同学一共完成了 140 道题,那么平均每人完成 道。平均数保留了总量信息,因为
还有一个很有用的性质:所有数据对平均数的有符号偏差之和为 0。
平均数像一个平衡点。左边的负偏差与右边的正偏差正好抵消。
如果不同数据代表的人数或时长不同,就不能简单相加后除以项数。权重分别为 时,加权平均数是
在通常的加权平均里,各个权重都应满足 ,而且不能全是 0。这样分母才不会为 0,权重也才能表示人数、时长或占比这类实际份额。
例如平时成绩占 、期末成绩占 ,平时 85 分、期末 75 分,那么总评是
这里不能把 85 和 75 直接平均成 80,因为两部分权重不同。
中位数只看排序位置。
例如数据 的中位数是 9;数据 的中位数是
中位数把有序数据分成左右两部分。它不关心最远的数到底离中心 20 还是 2000,所以不容易被极端值拖走。
众数是出现频数最高的值。它可能有一个,也可能有多个;如果每个值只出现一次,就没有明显众数。
众数的独特之处是它能处理类别数据。商店最常卖出的鞋码、问卷中选择最多的选项,都适合用众数。对连续测量数据,原始数值往往很少完全重复,这时通常先分组,再谈“频数最高的区间”,而不是硬找一个众数。
可以先问自己:你希望“中心”保留什么信息?
看一组具体数据会更清楚:
它的平均数是 ,中位数是 31。把 80 去掉后,平均数变成 30,中位数也变成 30。一个点让平均数移动了 ,中位数只移动了 1。不能因此说平均数“错了”,它准确反映了总量被 80 增大;只是当问题问“普通情况”时,中位数更贴近多数数据。
“平均”在日常语言里可能泛指典型水平,数学里却要说清是哪一种平均。报告结果时写“平均数”“中位数”或“众数”,不要只写一个含糊的“平均”。
算术平均数最常见,但增长率、速度和能量尺度有自己的结构。用错平均方法,公式算得再熟也会偏。
对 个正数 ,几何平均数是
它适合平均增长因子。某资产第一年增长 ,第二年下降 ,两年的变化因子是 1.2 和 0.8。算术平均增长率看起来是 0,但两年后的总因子其实是
每年的等效增长因子应满足 ,所以
等效年增长率约为 。先涨 再跌 并没有回到原点,因为第二次的 作用在已经变化的基数上。
几何平均要求输入有适合相乘的含义,通常使用正数。身高、考试分数这类加法型数据,一般不靠几何平均描述中心。
对 个正数,调和平均数是
它常出现在“相同路程下平均速度”这类问题里。
一辆车去程 60 千米,速度为 ;回程也是 60 千米,速度为 。总路程是 120 千米,总时间是
所以平均速度为
这个 48 正是 60 和 40 的调和平均数,而不是算术平均数 50。慢速阶段花的时间更多,它对总时间的影响也更大。
二次平均也叫均方根:
平方会让较大的绝对值获得更大权重,同时消除正负号。交流电的有效值、误差的均方根都使用这种想法。
如果 是正数,四种平均满足
只有当所有数相等时,等号才同时成立。这条关系还能解决一些最值问题:若若干非负数的和固定,它们越均匀,乘积越大;若正数的乘积固定,它们越均匀,和越小。
对任意实数,几何平均和调和平均未必有意义,但下面这条仍成立:
稍后会看到,均方根与方差之间只差一个“中心位置”。
平均数告诉你中心在哪,却不告诉你数据挤得有多紧。两组数据
平均数都是 50,但 B 的波动显然大得多。只报“平均 50”,会把这个差别完全藏掉。
极差是最大值减最小值:
A 的极差为 ,B 的极差为 。它简单,但只使用两端数据。中间的数据全部改变,只要最大值和最小值不变,极差就不变。
把数据排序后,中位数记为 。下半部分的中位数记为 ,上半部分的中位数记为 。四分位距是
它描述中间 数据横跨多宽。极端的最大值和最小值不直接进入 IQR,所以它比极差稳健。
小数据集的四分位数存在不止一种计算约定。有的软件在数据个数为奇数时把总中位数放进上下两半,有的软件不放。只要前后一致都可以,但做题或报告时最好说明约定。本章采用“总中位数不重复放入上下两半”的方法。
例如
中位数是 7。下半部分为 ,所以 ;上半部分为 ,所以 。于是
常用的异常值检查围栏是
25 超过上围栏,因此会在箱线图里单独标出。它只是“需要核查”的点,并不会因为超过围栏就自动从数据中消失。

直接把 相加没有用,因为正负偏差必然抵消为 0。方差先把偏差平方,再求平均。平方有两个作用:消除正负号,并让远离中心的点受到更大权重。
这里必须分清“总体”和“样本”。
如果手里的 个值就是我们要描述的完整总体,总体平均数与总体方差写成
总体标准差是
如果手里的 个值是从更大总体中抽出的样本,并想用它估计总体离散程度,常用样本方差
样本标准差为
这里要求 。如果样本只有一个数据,分母 就是 0,样本方差和样本标准差都不能按这两个公式计算。
为什么分母是 ?因为样本均值 也是用这批数据估出来的,而且所有偏差之和必须为 0。知道前 个偏差后,最后一个偏差已经被确定,只剩 个可以自由变化的量。用 能修正“样本围着自己的均值看起来偏紧”的系统性低估。
同一串数除以 还是 ,取决于你在回答什么问题。把这串数当作完整对象做描述,可以除以 ;把它当作样本并估计更大总体的方差,通常除以 。不要只看符号习惯,先看数据角色。
标准差的单位与原数据相同,但它不是绝对距离的普通平均。对完整总体而言,它准确的说法是:数据到总体均值的距离的均方根。样本标准差使用 作分母,是为估计总体波动而作的修正,不能把它直接叫作这 个距离的普通均方根。
对数据 A,均值为 50,平方偏差和是
若把 A 看成完整总体,则
对数据 B,平方偏差和为
所以

二次平均与总体方差之间有一个漂亮的关系:
如果把二次平均记作
那么
均方根同时包含“中心离 0 多远”和“数据围绕中心有多散”两部分。标准差则把中心位置拿掉,只看围绕均值的波动。
选图不是审美题。变量类型和你想回答的问题,决定了哪种图最合适。
类别变量先数每个类别出现多少次,得到频数;频数除以总数得到相对频数。
条形图适合比较类别。柱子之间留空,提醒读者“这些是分开的类别”。纵轴最好从 0 开始,否则很小的差别可能被视觉上夸大。
饼图适合展示少量类别占一个整体的比例,但类别多、比例接近时,人眼很难比较扇形角度。遇到这种情况,按频数从大到小排列的条形图通常更清楚。
小型定量数据可以用点图:每个观测值画一个点,重复值向上堆叠。它保留了原始数值,也能看出聚集和空缺。
茎叶图把数字拆成“茎”和“叶”。例如
可以写成:
若约定茎是十位、叶是个位,那么 表示 35。茎叶图保留每一个原始值,但数据量大时会变得拥挤。
直方图把连续数值分成相邻区间,再画出每个区间的频数或频率。因为区间连续,柱子通常挨在一起。
读直方图时,重点看四件事:
组距会改变画面。组距太宽会把细节抹掉,太窄又会让随机波动显得像规律。比较两组直方图时,应尽量使用相同区间和相同纵轴尺度。
箱线图把分布压缩成四分位数和须。箱体从 到 ,箱内的线是中位数;须通常延伸到围栏内最远的数据点,超过围栏的点单独标出。
这意味着标准的 1.5IQR 箱线图里,须的端点不一定是整组数据的最小值和最大值。把“最大值”直接写在右须上,有时会误导。
箱线图适合并排比较很多组数据:哪组中位数高,哪组箱体更宽,哪组偏斜或有异常点,一眼就能看到。它的代价是隐藏了峰形和具体数据,所以样本很小时,最好同时叠加原始点。
数据按时间顺序记录时,用折线图能保留先后关系。每天气温、月销售额、每分钟心率都适合。
别把时间顺序打乱后只算平均数。两个月平均温度相同,一个可能稳步升温,另一个可能先热后冷;这两种过程的故事完全不同。
一对定量变量来自同一个个体时,可以画散点图。每个点是 ,例如同一名学生的学习时长和测验成绩。
观察散点图时,不要只说“有相关”:

皮尔逊相关系数是
只要两个变量都不是常数,就有
的正负表示方向, 越接近 1,点越贴近某条直线;越接近 0,只能说明线性关系弱。它不等于“完全没有关系”。例如点落在清楚的 U 形曲线上,正负斜率会互相抵消, 仍可能接近 0。
“多大算强相关”没有放之四海而皆准的分界线。同一个 ,在噪声很大的社会调查里可能值得关注,在精密仪器校准里却可能远远不够。样本量、测量误差和研究目的都要一起看。
相关系数还有两个脾气:
看到 与 一起变化,至少还有三种可能:
夏季气温升高时,冷饮销量和游泳人数都可能增加。它们彼此相关,却不能据此说冷饮导致人去游泳。气温才是同时推动两者的混杂变量。
要更有把握地谈因果,需要研究设计提供支持,例如随机分组、控制其他条件、明确时间先后,并排除合理的替代解释。一个很大的相关系数本身做不到这些。
如果散点图大致沿一条直线分布,可以用
描述趋势。 是给定 后模型预测的值, 是实际观测值。两者之差叫残差:
残差为正,表示点在回归线上方;残差为负,表示点在线下方。这里量的是竖直差,因为模型用 预测 。
最小二乘法选择 ,让残差平方和最小:
斜率和截距可以写成
这里要求 ,也就是观测到的 不能全都相同。否则分母为 ,数据根本无法告诉我们斜率是多少。
回归线一定经过 。斜率 要连同单位解释: 每增加 1 个单位,模型预测的 平均改变 个单位。截距是 时的预测值;如果 0 不在数据范围内,或现实中根本不可能出现,就不要给截距强行编一个情境解释。
记录 5 次复习时长 与测验分数 :
先算出
斜率分子为
分母为
因此
回归方程是
斜率的意思是:在这批数据覆盖的范围内,复习时长每增加 1 小时,模型预测分数平均增加约 4.1 分。
当 时,预测值为 60,而实际值为 61,所以残差是
模型少预测了 1 分。
把横轴仍设为 ,纵轴改画残差,就得到残差图。合适的线性模型通常让点在 0 上下没有明显规律地散开。
如果残差呈 U 形,原关系可能是弯曲的;如果越往右越散,误差波动可能随 增大;如果某个残差特别大,应核查该点。回归线看着顺眼,不代表模型已经合格。
在观测过的 范围内预测叫插值。远远跑到范围外预测叫外推。上面的数据只覆盖 1 到 5 小时,用它预测 4.5 小时属于插值;预测每天复习 20 小时不仅是外推,情境本身也不合理。
决定系数可以写成
这个公式要求 不是常数,否则分母 为 , 没有定义。在含截距的一元线性回归中,若 与 都不是常数,才有 。它描述这条线相对于“永远预测 ”减少了多少平方误差。说“模型解释了多少样本内变异”可以,说“ 造成了这些变异”就越界了。高 也不保证外推可靠,更不保证未来数据仍按同一规律变化。
一个点与大多数观测差得很远,可能来自:
正确顺序是核查、解释、比较,而不是看到异常值就删。可以同时报告“保留异常值”和“排除确认错误值”两种分析,说明结论是否改变。若数据真实且属于总体,通常应保留,并考虑使用中位数、IQR 或更合适的模型。
再漂亮的图也修不好有偏的样本。常见偏差包括:
随机抽样的关键不是“看起来随意”,而是让总体中的个体有明确的抽中机会。分层抽样还可以先按年级、地区等重要类别分组,再在各层随机抽取,避免小群体被漏掉。
随机抽样主要帮助样本代表总体;随机分组主要帮助比较处理的因果效果。两个“随机”解决的不是同一个问题。
样本很大只能减少随机波动,不能自动消除系统偏差。一个有 10 万人参加的自愿网络投票,仍可能不如一个设计良好的小型随机样本可靠。
某站点记录 9 单配送时间,单位为分钟:
求平均数、中位数、极差、四分位数和 IQR,并判断怎样描述典型时间更合适。
数据已经从小到大排列。总和为 290,所以平均数是
观察值为
分别把它看作完整总体和来自更大总体的样本,计算方差与标准差。
两种解释下,中心都先算为
继续使用复习时长与分数的模型
回答:预测 时的成绩;解释斜率;判断能否据此证明多复习 1 小时会让每个人提高 4.1 分。
代入 :
某市想估计所有初中生每周参加体育活动的时间,从 12 所学校随机抽取 600 名初中生填写记录。
请指出总体、样本、个体、变量,并判断变量类型。
某小区 12 套成交房屋的价格中,有一套是面积很大的独栋住宅,价格远高于其余房屋。若要描述普通购房者最可能遇到的价格水平,应优先报告什么中心量?若要展示整组价格分布,适合什么图?
数据为
求平均数、中位数、、 和 IQR,并用 1.5IQR 围栏检查异常值。
数据 的均值为 5。分别计算总体方差与样本方差。
回答下面两个问题。
两个非负数 的和为 20。它们的乘积最大是多少?何时取得?
某校样本中,鞋码与身高的相关系数为 。判断下面三句话是否合理。
某回归模型对三个观测的预测值分别为 12、15、18,实际值分别为 13、13、21。求残差和残差平方和。
学校想估计全校学生每天使用手机的时长,于是在“数字戒断兴趣小组”中发放问卷,收回 300 份。样本量不小,这个结果可靠吗?
面对一份新数据,可以沿着一条固定但不僵硬的路线走:
统计不负责把不确定性变没。它真正提供的是一套诚实的表达方式:我们看到了谁,没看到谁;数据中心在哪里,波动有多大;哪些规律只是线索,哪些结论还需要更好的证据。
一共有 9 个数,第 5 个数 28 是中位数。平均数比中位数高约 4.22 分钟,提示右侧的 70 正在拉高平均数。
极差只看两端:
按本章约定,不把总中位数放入上下两半。下半部分为 ,所以
上半部分为 ,所以
四分位距为
上围栏为
70 超过上围栏,应核查原因。
如果 70 是真实的特殊延误,描述“普通一单通常多久”时,中位数 28 分钟更合适;若要估计 9 单合计占用了多少配送时间,平均数仍然有用,因为总时间等于 。最好同时报告中位数、IQR,并说明存在一单 70 分钟的延误。
平方偏差和是
若这 4 个值就是完整总体,分母用 :
若这 4 个值是样本,并用来估计更大总体的方差,分母用 :
两个答案都可能正确,区别不在计算技巧,而在数据的角色。报告时应明确写“总体标准差”或“样本标准差”。
预测成绩约为 62.05 分。3.5 位于观测范围 1 到 5 内,这是插值。
斜率 4.1 的准确说法是:在这 5 个观测覆盖的范围内,复习时长每增加 1 小时,模型预测成绩平均增加约 4.1 分。
不能把斜率直接说成因果效果。这些数据可能来自观察而非随机实验,基础水平、自律程度、课程难度等变量都可能同时影响复习时间和成绩。它描述样本中的线性关系,不保证每个人都提高 4.1 分。
上下围栏分别为
26 超过上围栏,因此被标成潜在异常值。平均数 10 高于中位数 8,也反映了右侧极端值的拉动。
若这三个数是完整总体,
若它们是用来估计更大总体的样本,
题目若只写“求方差”却没有说明数据角色,应根据课程约定判断,正式报告则应把分母和名称写清楚。
等效年增长率约为 ,不是算术平均得到的 0。
相同路程下平均速度使用调和平均:
全程平均速度是 40 千米每小时。较慢的一段耗时更长,所以结果小于算术平均数 45。
两边平方得到
当且仅当 时取等号。因此最大乘积是 100。直觉上,固定总量越均匀地分给两个因子,乘积越大。
残差平方和为
第二个残差为负,表示模型高估了 2;第三个残差为正,表示模型低估了 3。不能把残差写成 后又沿用这里的正负解释。