自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

预备代数

  1. 01数学基础与数的概念
  2. 02整数运算
  3. 03分数基础
  4. 04分数运算
  5. 05小数与运算
  6. 06百分数与应用
  7. 07代数表达式
  8. 08简单方程与不等式
  9. 09比例与比率
  10. 10几何基础与测量
  11. 11数据与统计入门
正在加载课程章节内容
课程数学预备代数数据与统计入门

数据与统计入门:让一组记录回答问题

上一章最后,我们给同一张桌子留下三次长度记录:119.8、120.0、119.9厘米。它们略有不同,我该选择哪一个数来描述结果?如果再出现一条150厘米的记录,是桌子变长了、测量对象弄错了,还是录入有问题?

公式可以继续处理数字,却不会自动替我们判断记录是否可靠。统计要做的,就是从明确的问题出发,整理数据、观察差异,再说明数据能够支持什么结论。

所以这一章不从“先求平均数”开始。我会先问:记录的是谁、什么时间、什么量,用什么方法得到?然后再选择表、图与统计量。

你会发现,统计没有离开前十章:频率使用分数和百分数,平均数使用加法与除法,加权平均连接比例,图像依赖坐标,所有计算仍要带着单位和适用条件。作为课程最后一章,我们把这些工具放到同一个问题旁边,再看它们怎样配合。


数据从哪里来:总体、样本、个体和变量

先研究一个具体问题:“本校七年级学生在指定的这一周,平均每天课外阅读多少分钟?”

总体是希望了解的全部对象,这里为本校七年级学生;样本是实际抽取来研究的一部分对象,例如从600名学生中抽取60名。若调查全部600人,则是对这个总体的全面调查。

个体是被研究的一个对象,这里为一名学生。变量是记录在个体身上的特征,例如指定一周的日均阅读分钟数、主要到校方式、同一次测验成绩。

一张每人一行的数据表,常用每列表示一个变量。但表格还有别的组织方式,不能把“每一行就是一个独立的人”当作永远成立的规则。

同一个人记录七天,不等于调查了七个人

60名学生各记录7天,可以有420条“学生—日期”记录,但仍然只有60名学生。同一个人的多天数据可能彼此相关,不能把420行说成420名独立受访者。

如果我们先给每名学生算七天平均,再每人留一行,分析的就是60个学生日均值。若直接研究每一个学生日,就换了观察单位,需要明确这种变化,并保留同一人的重复记录关系。

同样,桌子测量三次得到三条读数,不表示拥有三张桌子的样本。这一区分会影响后面能够推广的范围。

抽到的人数与实际可用记录数要分开

抽取60人,54人交回完整阅读记录,应分别报告抽取60人、收到54份、6份未收到。不能假装所有60人都有可用数据,也不能悄悄把没有回答的人从调查过程里抹掉。

不同分析的可用人数还可能不同。一个人填了阅读时间但没填测验分数,可以用于阅读时间的单变量描述,却不能组成完整的“时间—分数”配对点。

变量定义要让所有人在用同一把尺子

“阅读时间”需要说明是哪一天,还是七天平均;是否包含电子阅读;是否只算课外;单位是分钟还是小时。规则不统一,把不同答案相加就可能失去意义。

例如明确记录“某周七天的课外阅读,每天以分钟计,包含纸质与电子阅读,不含课堂指定阅读”。这不一定是唯一正确的定义,但全体必须采用同一规则。

我会尽量使用匿名编号,不收集与问题无关的姓名等信息。识别记录需要的编号,与真正需要比较的变量,不是同一件事。


看起来是数字,不代表每种算术都有意义

分类变量在给对象分组

主要到校方式可以分为步行、公交、自行车、家长接送等。把公交编码成2,不表示它是编码1的步行的两倍;直接平均这些任意代号,不能解释为一种平均交通方式。

球衣号码、学生编号也主要是标签。数字外观不保证数值间的差具有所需的数量意义。

分类变量还可能有顺序,例如“不满意、一般、满意”。这个顺序可以用于描述等级,但不能自动认为相邻两级距离相等,再把任意编码的平均值当成精确满意程度。

数值变量在计数或测量

一周借书本数可以取0、1、2、3……,属于离散变量;实际阅读时长可以继续细分,通常按连续量理解,即使记录时只保留整分钟。

计数数据的平均数却可能不是整数。平均借书1.4本,并不表示某人借走了0.4本;它表示总本数除以人数。实际个数与平均个数,第一章以来就要分清。

一个有意义的编码特例:0 与 1 指示是否发生

若明确规定“参加活动=1,不参加=0”,数据1、1、1、0的平均数为0.75,恰好表示参加比例75%。原因是把这些数相加,得到的就是参加人数。

这不是任意标签都能平均的理由,而是这个0、1编码有明确的计数意义。关键不在数字长相,而在我们为它定义了什么操作。

先问变量代表数量、顺序还是标签,再选统计量。对无序类别不能直接求有意义的数值平均;对有序等级也要说明数值刻度的含义,不能用编码制造并不存在的精度。


整理前先检查:缺失不是零,离谱也不一定是假

某三名学生的记录为20分钟、空白、40分钟。空白不等于0分钟。只对两条已知记录求平均,得到30分钟,并注明有效记录2条;擅自补零会得到20分钟,改变了结论。

若确实记录“这一天没有阅读”,零才是一个有效数值。清楚区分未回答、无法读数与真实的零,是数据整理的基础。

重复也要查原因:同一条记录误导入两次应去重;同一人不同日期的两条记录,未必重复。不要只凭数值一样就删除,因为两个人完全可能都读了30分钟。

有明确取值限制时,越界值需要核查,例如一道满分100的考试出现110分。若评分原本满分120,110又完全可能有效。规则先于“看起来奇怪”。

我会保留原记录与修改理由,不把修正理解为把数据改得整齐。不能因为一个值让平均数不好看,就把它删掉。


频数表:把重复收拢,同时保留总数

假设调查24名学生某一天的主要到校方式,每人只能选一项。多段出行按预先约定的主要路段分类,本例四个类别覆盖全部有效回答。

某类出现的次数为频数 fif_ifi​;除以有效记录总数 N>0N>0N>0,得到相对频数,本章也称频率:

pi=fiN.p_i=\frac{f_i}{N}.pi​=Nfi​​.
主要到校方式频数(人)精确频率百分比扇形圆心角
步行88/248/248/24约33.3%120度
公交66/246/246/2425%90度
自行车55/245/245/24约20.8%75度
家长接送55/245/245/24约20.8%75度
合计241精确合计100%360度

频数和为24;精确频率和为1;每类圆心角为 360×fi/N360\times f_i/N360×fi​/N 度,角度和为360度。

表中显示的近似百分数相加是99.9%,不是100%。这是逐项舍入造成的显示差,合计行使用原频数计算的精确整体,并不代表33.3、25、20.8、20.8直接相加会变成100。

总和规则依赖“不重叠且不遗漏”

如果允许多选“使用过哪些到校方式”,同一人可能计入多个类别,各类人数和可以超过24、百分比和可以超过100%。这不自动是计算错误,只是表已不再把24人分成互斥的几块。

还要注明频率的分母:是全部抽取者、实际回答者,还是某个子组?选择哪个取决于问题,但不能在不同类别中悄悄更换。

频数回答有多少,频率回答占多大比例。20人中12人步行与40人中18人步行,后者人数更多,前者比例60%高于后者45%,两种结论各有意义。


数值多了,可以分组,但不要忘记压缩会丢细节

下面是一份教学用的20名学生单日阅读分钟数,已经排序:

10,12,15,18,20,22,25,25,28,30,10,12,15,18,20,22,25,25,28,30,10,12,15,18,20,22,25,25,28,30, 32,35,35,38,40,42,45,50,55,70.32,35,35,38,40,42,45,50,55,70.32,35,35,38,40,42,45,50,55,70.

按20分钟宽度分组:

时间范围(分钟)频数相对频数
0≤x<200\le x<200≤x<20420%
20≤x<4020\le x<4020≤x<401050%
40≤x<6040\le x<6040≤x<60525%
60≤x<8060\le x<8060≤x<8015%
合计20100%

左端包含、右端不包含,所以40进入第三组,不同时进入第二组。分组既要互不重叠,也要覆盖所有实际数据;若出现80分钟,需要按预先规则扩展组别或明确最后一组的端点。

表更短了,原数值却不一定能恢复

分组表告诉我们有10人在20至40分钟之间,却不能恢复每一个具体读数。因此只看分组表,一般不能求出原数据的精确平均数或精确中位数。

用每组中点10、30、50、70代替组内所有数据,可估计平均数为

4×10+10×30+5×50+1×7020=33 分钟.\frac{4\times10+10\times30+5\times50+1\times70}{20}=33\text{ 分钟}.204×10+10×30+5×50+1×70​=33 分钟.

稍后直接用原数据会得到32.35分钟。33是分组近似,不是精确值;只保留表以后,原来丢失的细节不会被公式自动补回来。

组距过宽会掩盖分布形状,过窄会变得零碎。比较两组数据时,使用相同分组边界与刻度更便于判断,也可以检查合理改变组距后,观察到的特点是否仍在。


选图:先决定希望读者看见什么

条形图比较类别,别让基线改写差距

主要到校方式适合条形图,类别之间留空隙,条的长度表示人数或比例。类别名字较长时,横向条形图更方便读。

数量用条长表达时,通常从0开始。8人与6人的比为4比3;若纵轴从5起画,可见条长变成3与1,看起来像三倍,视觉印象已偏离原来的数值比。

条形图也可以展示多选问题的各类人数,但要说明类别可能重叠,不能把它们误当作互斥整体。

折线图保留自然顺序,但线不是额外测量

周一到周五每天的图书馆访问人数,可以按时间连线。日期、时刻有先后,线帮助观察升降。

无自然顺序的血型、颜色或书店名称,随意连线会制造不存在的连续趋势。若按时间作图,横轴还要反映真实时间间隔,不把间隔一天与间隔一个月画成同样的距离而不说明。

每天只测一次温度,连接线不表示两个观测之间的每分钟温度都恰好沿直线变化。折线图的纵轴可以按分析需要选择非零起点,但必须清楚标刻度,不能用截断后的视觉高度比冒充真实数值比。

扇形图适合把一个整体分成几块

前面的单选到校方式表,类别互不重叠又覆盖全部,可以用一个圆表示。每块角度与面积都对应频率。

多选比例加起来可能超过100%,不能原样塞进表示“受访学生整体”的饼图。若改用“全部选择次数”为分母,画出的则是选择次数构成,要明确它不是人数比例。

两个班都25%的扇形,实际可能是5人或10人,因此要同时交代总体或样本量。样本5人中3人选择某项,虽然是60%,换一个人的回答就变化20个百分点,别只留下一个显得很稳定的百分数。

直方图把数值区间排在数轴上

直方图研究一个数值变量的分布。相邻组柱子相接,横轴是有宽度的数值区间,不是可以任意重排的类别名字。

前面的阅读数据各组等宽,可以用频数或相对频数作柱高,并明确纵轴。读图时看集中位置、跨度、左右长尾、缺口与可能的多个高峰,而不只找最高的柱。

选读:组宽不同,要看面积,不只看高度

若组宽不同,要让柱的面积对应频数,常用

频数密度=频数组宽\text{频数密度}=\frac{\text{频数}}{\text{组宽}}频数密度=组宽频数​

作高度。例如0至10有4条记录,10至30有6条记录,组宽分别10与20,高度应为0.4与0.3。

第二组柱子更低,但面积 0.3×20=60.3\times20=60.3×20=6 更大,包含的记录更多。直接把4与6当不同宽度柱子的高度,会把组宽带来的面积变化也混进数量表达。

使用相对频数密度时,高度为相对频数除以组宽,总面积为1。无论哪种,先读纵轴,再决定能否从高度直接读人数。

条形图、截断基线、折线图、饼图与直方图的选择和读图检查示意

读图时,把眼睛看到的量与数据单位对齐

我会先看标题覆盖谁和哪段时间,再看坐标轴单位、起点与间隔。两张图刻度不同,柱子看起来一样高,不表示数值一样。

图标若高宽都放大2倍,面积便放大4倍,不能再把面积印象当成数量只翻倍。只挑一段持续上涨的时间,也可能掩盖更长时间里的回落。

画面漂亮不是证据。先核对图形编码的是长度、面积还是位置,再回到原数值比较。


平均数、中位数、众数:三个问题,不是一个万能答案

平均数保留总量,再均分

对非空的 nnn 个数值,算术平均数为

xˉ=x1+x2+⋯+xnn,n>0.\bar{x}=\frac{x_1+x_2+\cdots+x_n}{n},\qquad n>0.xˉ=nx1​+x2​+⋯+xn​​,n>0.

想象把几个杯子中的水量合起来,再平均分成同样的份数。平均的是水量;若杯子形状不同,不能把水面高度直接当成水量来均分。

平均数不一定是原数据中的一个值。几个人实际借书本数为整数,平均数可以是1.4本。它描述总量除以人数,不是某个人真的借了小数本书。

例题:六个成绩的平均数

一份满分120的测验,六个成绩为

62,75,75,80,88,95.62,75,75,80,88,95.62,75,75,80,88,95.

总分475,平均数为 475/6≈79.17475/6\approx79.17475/6≈79.17 分。这里只是在概括这六条成绩,不代表整个学校的平均分。

中位数先排序,再找中间位置

奇数个数据取中间数;偶数个数据取中间两个数的平均。上面的第3、4个数是75与80,中位数为77.5分。

中位数强调位置,不要求是一个真实出现的观测值。有重复数据时,也不能说“严格比它小和严格比它大的人数总相等”。更准确地说,至少一半的数据不大于中位数,至少一半不小于中位数。

例如1、1、1、4、8的中位数为1,严格小于1的数一个也没有。排序的中间位置依然清楚,不能被错误的口头解释否定。

众数问最常出现的值或类别

六个成绩中75出现两次,其他各一次,所以众数为75。到校方式表中,步行频数最高,众数是“步行”,不是数字8;8是它的频数。

2、2、3、4、4的众数为2和4,并列最高。本章对所有数值各出现一次的情况,说没有突出的众数;类别频数完全相同时,直接报告各类一样多,避免给一个没有区分作用的名称。若所有观测都是同一个值,那个值当然是众数。

改变极端成绩,三个中心怎样反应

把前例最高分95改成110,仍在120满分范围内。新总分490,平均数约81.67;中位数仍77.5,众数仍75。最大值的改变明显影响均值,却没有改变中间两个位置。

同一分数轴上,将95改成110前后的平均数、中位数、众数与极差比较

这里是人为改变一条数据的教学比较,不是建议为了得到较高平均分而修改真实成绩。真实数据的纠正必须有原始记录支持。

使用实验时,可以先保持中间数据不变,只移动最左或最右的值,预测均值是否改变、中位数是否改变。中位数对末端数值通常更稳健,不表示无论怎样改数据它都不变。

选哪个中心,要看我们的问题

五户家庭某月用电量180、195、205、220、700千瓦时。平均数300,中位数205。描述排在中间的一户,中位数更贴近这组数据主体;核对总用电量,平均数又很有用,因为 300×5=1500300\times5=1500300×5=1500。

分类问题常看最常见类别;数值分布大致对称、没有明显极端值时,均值常有用;明显偏斜时,可以同时给均值和中位数,并配分布图。

没有一个中心能保证描述所有个体。均值不是“大多数人的实际值”,中位数不是“出现最多的值”,众数也不保留全部总量。


极差与分布:中心相同,队形可能完全不同

比较两组教学数据:

甲:48,49,50,51,52,乙:30,45,50,55,70.\text{甲:}48,49,50,51,52, \qquad\text{乙:}30,45,50,55,70.甲:48,49,50,51,52,乙:30,45,50,55,70.

两组均值与中位数都为50。极差是最大值减最小值:

R=xmax⁡−xmin⁡.R=x_{\max}-x_{\min}.R=xmax​−xmin​.

甲为4,乙为40。它们的中心相同,已观测数值的跨度却很不同。

同一数轴上,两组中心都为50,但极差分别为4和40

如果这是各五次零件长度记录,可以说甲这五条记录更集中;不能仅凭五条数据就保证整个生产过程今后一定更稳定。样本描述与对过程的推断不是同一层结论。

极差只看两端,会漏掉中间结构

30、31、32、33、70的极差仍为40,却与乙组的中间分布不同。极差不知道多数数据挤在哪里,也不衡量是否达到了某个目标值。

一把偏了2厘米的尺子,重复读数可能很集中,却仍不准确。测量的分散小,与距离真实值近,是不同问题。

之后学习四分位距、方差与标准差,可以利用不同的结构描述分散。现在先记住:一个中心通常不够,还要观察跨度、分布形状与数据来路。

离群值先查原因,不要先删

12、13、13、14、15、47中,47远离其他值,值得回查。但仅凭远离主体,不能断言它是错数,更不能直接替换成自己猜测的14.7。

检查原始表、单位、对象与仪器。确认笔误,可以按记录纠正并保留痕迹;确认测量过程无效,可以按明确规则处理;真实但少见的长等待或高用量,可能正是需要研究的现象。

为观察敏感性,可以分别计算包含与不包含它的结果,但要标明后一种是排除该记录后的另一组数据,不能把删除后的“好看结果”冒充全部样本。

异常值不是自动无效值,缺失值不是自动零值。整理数据的目标是准确保留和解释信息,不是让图形更整齐或让结论更符合期待。


加权平均:谁重复得多,谁按规则占比大

第九章平均速率按时间加权,合并成本按数量加权。这里把同一种思想写成更一般的式子:

xˉw=w1x1+⋯+wkxkw1+⋯+wk.\bar{x}_w=\frac{w_1x_1+\cdots+w_kx_k}{w_1+\cdots+w_k}.xˉw​=w1​+⋯+wk​w1​x1​+⋯+wk​xk​​.

本章的平均使用非负权重,且权重总和为正。这样结果位于参与数据的最小值与最大值之间;全为零的权重不能作为分母。

权重可以表示重复次数,也可以来自题目规定的评分比例。它不是随意给喜欢的数字更大分量。

例题:总评的分量不相同

同为百分制的练习、项目、期末成绩分别88、92、76,评分规则给权重30%、20%、50%。

先确认三项分数使用同一量表,再检查规定的比例合计100%。这一检查必要,但单凭和为100%,并不能证明项目定义一定没有遗漏或重复,还要读评分规则。

贡献分别为 0.3×88=26.40.3\times88=26.40.3×88=26.4、0.2×92=18.40.2\times92=18.40.2×92=18.4、0.5×76=380.5\times76=380.5×76=38。

合计82.8分。简单平均约85.33分,回答的是三项等权的另一种规则。

三项满分不同,不能不归一到共同尺度,就拿原始分数套同一个百分比权重。题目若给的是点数累计规则,按那套规则计算,不强行改成另一种平均。

频数就是重复次数

某组20名学生,一周借书0、1、2、3本的人数分别4、7、6、3。平均借书数为

0×4+1×7+2×6+3×320=1.4 本.\frac{0\times4+1\times7+2\times6+3\times3}{20}=1.4\text{ 本}.200×4+1×7+2×6+3×3​=1.4 本.

不需要把1抄七次、把2抄六次,乘频数已经保留了重复信息。反过来,只把0、1、2、3平均为1.5,就丢掉每种值出现多少次。

合并组均值,要恢复组总量

两组互不重叠、分数口径相同,甲10人均分80,乙30人均分90。全体平均为

10×80+30×9010+30=87.5.\frac{10\times80+30\times90}{10+30}=87.5.10+3010×80+30×90​=87.5.

不能直接平均成85。两组人数相同,或两组均值本来相同,简单平均也会得到正确合并值;一般情况下先恢复总分、再除总人数最稳妥。

如果已知组均值只是保留一位小数的近似值,乘人数得到的也是估计总分,不能再报告一个比原数据支持的精度更高的精确全体均值。


比较两组:同条件、中心、分散与人数一起看

两个服务窗口各记录5次等待,记录方法与所选时间段相同:

甲:4,5,5,6,10,乙:5,5,6,6,8.\text{甲:}4,5,5,6,10, \qquad\text{乙:}5,5,6,6,8.甲:4,5,5,6,10,乙:5,5,6,6,8.

两组总和30、记录数5,均值都为6分钟。

甲中位数5、极差6;乙中位数6、极差3。

可以说:“这份记录中,甲的中位等待较短,但跨度较大;乙的记录较集中,均值都为6分钟。”

不能仅凭这些数说两个窗口永远一样快,或保证其中一个对未来所有人更好。客流、业务复杂度与抽样方式还可能不同。

比较分布图也要统一刻度。样本人数不同,频数柱高会反映总人数差异;若问题关注分布构成,可用相对频数,并同时保留样本量。

样本大通常能在适当随机设计下减少抽样波动,但不能自动修复偏差。500条同一个人的重复记录,也不能直接与500名不同人的样本混为一谈。


散点图:保留同一对象身上的一对数

想研究阅读时间与测验分数的关系,每名学生要留下完整配对。教学示例为

(10,62),(15,66),(20,70),(25,68),(10,62),(15,66),(20,70),(25,68),(10,62),(15,66),(20,70),(25,68), (30,76),(35,79),(40,81),(50,86).(30,76),(35,79),(40,81),(50,86).(30,76),(35,79),(40,81),(50,86).

横坐标为阅读分钟数,纵坐标为同一次测验分数,每名学生一个点。点总体从左下向右上,可以描述为正向关联:阅读时间较大时,分数往往也较大。

这里“往往”很重要。25分钟对应68分,低于20分钟对应的70分,因此不是每一对点都严格上升,也不是已经得到一个精确的一次函数。

不要分别排序两列后重新配对

阅读时间与分数各自排序,再把第一个与第一个拼在一起,可能人为制造向上的趋势。研究关系时,必须保留原来的对象配对。

同一横坐标可以出现几个不同纵坐标:两名学生都读30分钟,不一定得同分。这也提醒我们,数据中的关系不自动是确定函数。

看方向,也看形状与分组

点云向右上是正向关联,向右下是负向关联;还要看是否接近直线、是否弯曲、是否出现不同组,以及有无异常点。

看不出直线趋势,不等于完全没有关系。U形分布可能有很清楚的非线性结构,却不能用单一向上或向下概括。本章先作定性观察,不把任何“相关”都等同于线性相关系数。

普通散点图不按录入先后把点连起来,因为输入表格的先后并不是变量变化的过程。同一对象随时间的轨迹若需要连线,要另说明时间顺序。

样本范围之外,不能随意延长趋势

上面的阅读记录只覆盖10至50分钟。不能仅凭这些点,就断言读500分钟会按同一趋势得到某个分数。测验还有满分边界,关系也可能在其他范围改变。

异常点可能影响趋势判断,但也不能因为一个点不在预期方向就删除。先回查记录与背景,再说明处理方法。


关联不是因果:两个量一起变,不等于谁推动谁

看到阅读时间与分数正向关联,不能只凭散点图断言“增加10分钟必定提高多少分”。可能有其他解释:原本阅读能力较强的学生更愿意阅读;课程兴趣同时影响阅读与表现;只调查某个社团,也可能改变看到的关系。

这些是需要检验的可能解释,不是已经从这份数据确定的事实。统计报告不能为了讲一个顺畅故事,就把一种猜测写成唯一原因。

随机抽样与随机分组做不同的工作

随机抽样考虑从总体中怎样选人,关系到样本覆盖谁、结论能推广到哪里。

随机分组考虑已经参加研究的人怎样进入不同条件。合理的随机分配能减少组别选择与原有特征系统关联的风险,为比较干预效果提供依据,但不保证每次小样本分组都在所有特征上完全平衡。

还要检查是否真正执行分配、有没有中途退出、测量是否一致、组间是否互相影响等。随机两个字不会自动消除全部研究问题。

良好的实验设计可以提供比单纯观察更强的因果证据,但结论仍有不确定性与适用范围。没有随机抽样的实验,可能较适合比较参与者中的效果,却不能不加说明就推广到所有人。

“这份样本中两者常一起变化”是观察描述;“主动改变一个量,会导致另一个量变化”是因果判断。散点图本身不能确定作用方向,也不能排除其他共同影响因素。


抽样方法:人数多,不一定覆盖得对

想研究全校早餐情况,却只在食堂早餐窗口调查很多人,会漏掉不在食堂吃早餐、甚至不吃早餐的学生。增加同一处的问卷数量,并不能自动把遗漏群体补回来。

方便抽样只接触容易遇到的人;自愿扫码可能吸引态度更强烈的人;不完整名单产生覆盖不足;抽中但不回复的人与回复者可能不同,形成无回答偏差风险。

这些都在提醒我们检查产生记录的过程。随机样本也可能偶然偏离总体,有偏的方法也可能某次碰巧接近总体;不能只看这一次数字顺眼,就判断方法没有问题。

简单随机抽样,不只是每个人机会看起来相同

固定从 NNN 个对象中不放回地抽 nnn 个,简单随机抽样要求每一种可能的 nnn 个对象组合有相同被选机会。可以给完整名单编号,再用均匀随机的方法选出不同编号。

它会使每个人入样机会相同,但仅有这一条还不够。例如从同人数的几个班里随机抽一个整班,各学生机会相同,抽到的却只能是整班组合,不能得到任意混合的学生组合,因此不是学生层面的简单随机样本。

按组抽样,要说明怎样分配名额

若希望各班都有记录,可按班级分层,再在每班随机抽取。按人数比例分配通常便于保持整体结构;若各班抽取比例不同,合并估计时还需适当权重,不能把样本中每班人数比例直接当作全体比例。

随机选择不保证所有抽中者都回复。发500份,只收到50份,要报告发送与回复情况,并检查未回复者是否可能系统不同,不把缺失部分自动当成相同答案。

全面调查也会有漏报、重复和测量错误。“问了所有人”可以免去抽取样本的那一步,却不等于后续数据天然无误。


问卷的措辞,也会改变我们测到什么

“为了让学校更文明,你是否支持这个显然更好的方案?”已经在问题里替回答者作了价值暗示。更中性的写法是:“你是否支持方案A?支持、不支持、不确定。”

但态度问题与行为问题仍不同。问某一周实际去了图书馆几次,不能直接替代是否支持延长开放时间;问是否支持,也不能当作实际会去几次。

一道题只问一个清楚问题

“食堂是否便宜又好吃”同时问价格和味道,回答不同意时不知道在反对哪一项。可以拆开问,并给清楚的选项。

“经常阅读吗”没有统一时间范围,不如记录指定七天每天的分钟数。年龄分组10至12、12至14会重叠,要明确如 10≤a<1210\le a<1210≤a<12、12≤a<1412\le a<1412≤a<14,并覆盖实际可能的其他年龄。

允许“其他”“不确定”或按需跳过,可能比强迫每个人选一个不合适类别更诚实;分析时也要说明这些回答与缺失怎样处理,不能无声删除。

例题:改进一个放学后的方便调查

学生会想了解七年级某周的日均课外阅读时间,只在放学后篮球场询问30名愿意停下来回答的人。

总体是该校七年级学生,而现场实际对象还要确认年级,不能把碰巧遇到的其他年级学生混进去。

场地与自愿回答可能使样本偏向某些群体,30人本身不能证明覆盖完整。

可以从七年级完整名单随机抽取,或分班按合适比例随机抽取,再采用同一周、同一定义的记录表。

保留未回复情况,自报时间可能仍有误差。报告写清实际方法与限制,不把一次设计改进说成绝对准确。


把一份数据真正读完:从原始记录到结论

回到前面20名学生的单日阅读记录。它是一份给定的教学样本,没有提供随机抽样过程,所以我们先只描述这20条记录。

表和图告诉我们分布在哪里

四个等宽组的频数为4、10、5、1,说明其中10条在20至40分钟之间。排序还能看见两个25、两个35,以及一条70分钟。

70较其他大多数值高,值得了解背景,但仅凭这个值较大,不能判定它错误或直接删去。

用原数据求精确统计量

20个数相加为647,平均数 647/20=32.35647/20=32.35647/20=32.35 分钟。

中间第10、11个数为30与32,中位数31分钟。

25与35各出现两次,并列众数;最大70、最小10,极差60分钟。

用分组中点得到的33分钟只是近似均值,不能覆盖原数据直接算出的32.35。

结论既说结果,也说范围

可以写:“在这20条单日阅读记录中,平均数32.35分钟,中位数31分钟;一半记录在20至40分钟之间,极差60分钟。统计结果描述这份样本,不能仅凭它推断全校每人每天都读约32分钟。”

同样,若有完整的“阅读时间—测验分数”配对,可以用散点图描述样本关联。若只有两组分别收集的平均数,没有同一对象配对,就不能凭它们编造学生层面的散点图关系。

桌长的三次测量,又怎样概括

119.8、120.0、119.9厘米,均值119.9厘米,中位数119.9厘米,极差0.2厘米。可以报告这些记录的中心与跨度。

但不知道仪器和方法的误差,只凭三次读数不能保证真实桌长必在这0.2厘米范围里。三次都把起点错放,同一个偏差就可能一直存在。这与上一章对舍入区间的提醒完全相接。


综合练习:先想数据能回答什么,再计算

1. 对象与变量

某校从七年级抽取80人,调查指定一周使用图书馆的次数。指出总体、样本、个体与变量类型。

总体为本校全体七年级学生;抽取样本为80名学生;个体为一名学生;变量为指定一周使用图书馆的次数,是数值型离散变量。若有未回答者,还要另报可用记录数。

2. 类别与频率

30人各选一种当天主要午餐主食:米饭12、面食9、面包6、其他3。求频率与众数,并选择图形。

频率分别40%、30%、20%、10%,众数是米饭,频数12。条形图适合比较类别;互斥且完整的这四类也可以作扇形图。类别无自然连续过程,不宜随意连折线;它们也不是数轴区间,不能当作直方图。

3. 四种统计量

等待时间4、5、5、6、7、21分钟,求均值、中位数、众数与极差。

总和48、共6条,均值8分钟;中位数 (5+6)/2=5.5(5+6)/2=5.5(5+6)/2=5.5 分钟;众数5分钟;极差17分钟。21拉高均值,但不能因此直接删除。描述主体时中位数有用,同时应报告长等待这一现象。

4. 相同中心与不同跨度

甲6、7、8、9、10;乙4、7、8、9、12,中心与极差怎样比较?

均值和中位数都为8,甲极差4、乙极差8。可以说乙这组记录跨度更大;不能仅凭这两组小样本,就把结论无条件扩展到整个来源总体或所有未来记录。

5. 加权成绩

三项同为百分制,参与、作业、项目依次95、84、78,占总评20%、30%、50%,总评多少?

0.2×95+0.3×84+0.5×78=83.20.2\times95+0.3\times84+0.5\times78=83.20.2×95+0.3×84+0.5×78=83.2 分。必须使用给定权重,不替换成三项等权。

6. 哪条线没有实际过程

把四家书店名字排在横轴,依次用折线连接当天销量,有什么问题?

录入的书店顺序不是自然连续过程,连线容易制造趋势,应通常改用条形图并说明销量单位。若是同一家书店连续月份的数据,才有适合观察的时间顺序。

7. 正向关联能确定原因吗

假设样本中气温较高的日子,某场所冷饮销量也较大。能仅凭散点图断定购买冷饮使天气升温吗?

不能。图只显示共同变化,没有确定作用方向。气温影响购买、季节或客流同时影响记录等,都可能成为进一步调查的解释;这些可能性也不能只凭同一张图就自动当成已经证实的因果结论。

8. 问卷多就一定可靠吗

在晚自习后请路过办公室、愿意扫码的人作答,收到420份,能保证代表全校意见吗?

不能。接触地点与自愿参与可能产生选择偏差,大样本不自动补回未覆盖者。应检查完整抽样名单、选取方法、问题措辞和未回复情况,并限制结论范围。

9. 分组边界

采用 0≤x<200\le x<200≤x<20、20≤x<4020\le x<4020≤x<40、40≤x<6040\le x<6040≤x<60,40放哪组?出现70怎么办?

40进入第三组。70没有被这三组覆盖,需要按一致规则补充覆盖范围,例如增加 60≤x<8060\le x<8060≤x<80,不能漏掉它或硬塞进第三组。分组既要不重叠,也要不遗漏。

10. 描述与因果分别怎么写

样本散点图显示阅读时间与分数正向关联,写一个可支持的描述,再指出不能直接推出的结论。

可以写“这份样本中阅读时间较长者往往取得较高分数”。不能只凭此断言“主动增加阅读时间必定让每个人提高固定分数”。个体差异、其他变量和研究设计仍未被排除。

11. 组宽不同时,最高柱一定人数最多吗

0至10区间4条,10至30区间6条,用频数密度作高度,哪根柱更高、哪组记录更多?

高度分别0.4与0.3,第一根更高;频数看面积,第二组 0.3×20=60.3\times20=60.3×20=6,记录更多。不能把密度高度直接当频数。

12. 七天记录与七个人

60人各填7天,共420行,可以称为420名独立受访者吗?其中一行空白可以按0分钟补入吗?

不可以。只有60名受访者,同一人的重复记录要保留关联。空白不等于确实没有阅读,不能无依据补零;按分析目的说明缺失处理与有效记录数。

13. 中位数一定严格左右各半吗

数据1、1、1、4、8的中位数是什么?严格小于它的数有几个?

中位数1,严格小于它的数有0个。有重复值时,准确性质是至少一半数据不大于中位数、至少一半不小于中位数,而不是严格小与严格大的人数必然各半。

14. 压缩数据之后还能精确恢复吗

阅读数据分成0至20、20至40、40至60、60至80四组,频数4、10、5、1。用组中点得均值33分钟,可以说原始均值一定等于33吗?

不能。组中点代替未知组内值给出估计。本章原始数据的精确均值32.35分钟,已说明同一分组表并不保留精确均值所需的全部细节。


回看整门预备代数:工具不同,检查习惯相同

第一章,我们先说清单位,再用位值与数轴记录数量、位置和距离。第二章把方向与变化放进整数运算。第三、四章让单位继续细分,用等值分数、约分、通分和四则运算处理整数写不完的关系。

第五章的小数继续沿用十进制,提醒我们区分精确值与舍入。第六章的百分数始终追问基准是谁。第七章用字母保存一类计算,第八章用方程与不等式找出满足条件的所有允许值。

第九章把两个量的对应写成比、单位率、正比例与反比例,第十章把单位铺成面积、叠成体积,并检查真实测量与理想公式的距离。

最后,统计把一条记录扩展成一组记录。我们既计算中心,也看差异;既看图表,也问样本怎样得到;既描述关系,也不把观察到的关联自动写成因果。

这门课不要求你从此不犯错。我更希望你在遇到新题时,有一套能实际使用的顺序:先问对象与单位,再写数量关系;计算时保留条件,算完回到原问题;数据不够时说清还缺什么,不用一个漂亮数字掩盖不确定。


继续学习:把已经懂的关系带进基础代数

完成预备代数后,下一步的基础代数会更系统地研究表达式、方程、函数和图像。你已经认识字母与坐标,不需要把它们当作陌生的符号重新开始。

一次收费规则可以成为直线模型;不同输入产生的输出,可以排列成表格和图像;统计数据围绕模型的偏离,又会提醒我们模型不是现实本身。

开始下一门课前,可以再做三件检查:能否把一道分数或百分数题的基准说清;能否解释方程为什么这样变形;能否把一个答案连同单位与允许范围读回题意。

这些检查比多背几条孤立公式更能支撑继续学习。我们已经从数走到了关系,再从关系走到数据。接下来,只是把这条路走得更深一些。

上一章几何基础与测量