统计学最容易让人产生的一种错觉,是“表格里已经有很多数字,答案应该就在里面”。其实正好相反:数字越整齐,我们越容易忘记追问它们是怎么来的,又在替谁说话。
一条新闻说“本市高中生平均每天运动 42 分钟”,看起来只需要理解“42”这个数。可只要多问几句,事情立刻变复杂:新闻说的是所有高中生,还是参加问卷的高中生?“运动”包不包括步行上学?每天 42 分钟是过去一天、过去一周,还是一个学期的平均?没有回答的人会不会恰好更少运动?
这并不是故意挑刺。统计学研究的本来就不是确定答案,而是怎样用有限、会波动、可能不完整的数据,做出尽量可靠的判断。学这门课的第一步,不是急着算平均数,而是先把数据里的对象、变量和范围摆正。

数据更像证据,不像判决书。它能支持某种判断,也会留下新的疑问。
看到一个统计结论时,先问三件事:观察了谁,记录了什么,想说明谁。只要这三件事没有对齐,再精确的小数也可能没有解释力。
我们用一个案例贯穿这一节。
某校高一年级共有 620 名学生。学校正在考虑要不要增开一班早晨接驳车,于是从这 620 人中随机抽取 60 人,记录他们平时的通勤方式、单程通勤时间、需要换乘的次数、过去一周是否迟到,以及对当前通勤状况的满意程度。
这项调查真正要支持的是一个决策:有没有必要增开接驳车?要回答它,光知道“平均通勤时间”还不够。学校还得知道哪些学生通勤困难、困难表现在哪里,以及抽到的 60 人能不能代表全年级。
先把最基本的统计语言放到案例里。
这几个词看起来只是名词,实际是在检查一条证据链:我们逐个观察个体,在每个个体身上记录变量值,把许多记录组成数据,再用样本去了解总体。
个体是被逐个观察的对象,也叫观测单位或案例。个体不一定是人。研究医院的候诊时间时,一个个体可能是一名病人;研究城市空气质量时,一个个体可能是某个监测站在某一天的记录;研究网购退货时,一个个体可能是一笔订单。
“一行对应一个个体”是数据表最常见的组织方式,但不能机械地把“人”当作个体。假如一名学生连续 14 天每天填写一次通勤记录,那么每一行更可能对应“某名学生的某一天”,同一名学生会出现 14 行。判断个体时,要问的是:这份表里,每一行代表一次什么样的观察?
变量是对每个个体记录的特征。你可以把它理解成对每一行都要问的同一个问题:“通勤方式是什么?”“用了多少分钟?”“上周迟到过吗?”
变量值是某个个体对这个问题给出的具体答案。“单程通勤时间”是变量,“38 分钟”是变量值;“是否迟到”是变量,“是”是变量值。把变量和变量值混在一起,后面就很容易把“要研究什么”和“实际观察到什么”混为一谈。
下面是这项调查中的五行示意数据。案例是教学用的假设情境,表中数值只用来帮助我们读懂数据结构。
通常每一行对应一名学生,每一列对应一个变量,每个单元格是一个变量值。整张表称为数据表或数据矩阵。以后增加一名学生,就增加一行;增加“出门时间”这个变量,就增加一列。
学生编号里可能含有数字,但它只是标签。把 G101、G102、G103 中的数字部分求平均没有实际含义。电话号码、邮政编码、球衣号码也一样:长得像数字,不代表它就是定量变量。
这件事很反直觉,因为我们习惯于“只要是数字就能算”。统计里更可靠的判断方法是:加减、求差、求平均以后,结果有没有现实含义?如果没有,它大概率只是分类标签。
如果 G103 没有回答满意程度,这个格子应标记为缺失,而不能写成 0。0 可能是一个真实的变量值,例如换乘 0 次;缺失表示“我们不知道”。两者如果混在一起,平均数、比例和图表都会被悄悄改变。
“没有记录”不等于“记录为零”。整理数据时要同时保存变量定义、测量单位和缺失值规则,否则一张看起来干净的表也可能无法正确解释。
初学统计时,最常见的冲动是见到一列数据就求平均数。可有些列适合求平均,有些列只能数每一类有多少个。变量类型决定了我们能问什么问题,也决定了后面该用什么图表和计算方法。
分类变量记录类别或状态。通勤方式可能取“步行、骑行、公交、地铁、家人接送”,是否迟到可能取“是、否”。对这类变量,我们通常统计每一类的人数或比例。
分类变量还可以分成两种。
满意程度即使编码成 1、2、3,也不会自动变成真正的定量变量。“满意”与“一般”的差距,未必和“一般”与“不满意”的差距相同。编码只是方便存储,不会改变变量本身的含义。
定量变量记录数量或大小,数值之间的差和平均通常有意义。单程通勤时间、身高、温度、考试分数都属于这一类。
定量变量又可以分为离散变量和连续变量。
离散变量来自计数,可能值之间有明显的跳跃。换乘次数可以是 0、1、2 次,不会是 1.37 次;一个家庭的孩子数、一周迟到次数也都是离散变量。
连续变量来自测量,在一定范围内可以取任意精细的值。通勤时间可能是 31 分 20 秒,身高可能是 171.24 厘米。表里把通勤时间四舍五入成整数分钟,只是记录精度有限,并不把“时间”变成离散变量。判断离散还是连续,要看它本来是计数还是测量,不能只看表里有没有小数点。

先问数值是否表示可计算的数量,再判断它来自计数还是测量。
如果记录“实际年龄 15.7 岁”,年龄是连续的定量变量;如果只记录“15 岁、16 岁、17 岁”,通常仍把年龄理解为连续变量,只是按整岁记录;如果把年龄改成“15 岁及以下、16 岁、17 岁及以上”,它就变成了有序分类变量。
同一个现实特征可以因为记录方式不同而成为不同类型的变量。所以我们不能只看列名,还要看变量的具体定义和值是怎样记录的。
可以按下面的顺序判断。
先问这个值是在给对象贴类别标签,还是在测量数量。“公交”是类别,“38 分钟”是数量。
如果是类别,再看类别之间有没有自然顺序。通勤方式没有顺序,满意程度有顺序。
如果是数量,再问它来自计数还是测量。换乘次数来自计数,是离散变量;通勤时间来自测量,是连续变量。
最后检查数值是不是编号或编码。编号即使全由数字组成,通常仍是分类标签。
总体是研究问题真正想覆盖的全部对象,样本是实际观察到的那部分对象。在通勤案例里,总体是 620 名高一学生,样本是被抽到的 60 名学生。
这个定义有一个常被忽略的细节:总体由研究问题决定。如果学校只想改善住校生周末返校交通,总体就应是住校生;如果要为全校三个年级安排接驳车,总体又会扩大到全校学生。同一份 60 人数据,面对不同问题,代表能力完全不同。

样本是我们实际看见的一部分,总体是我们最终想判断的整体。
把总体中的每一个对象都调查一遍叫普查。总体很小时,普查有时可行;但总体很大、测量昂贵,或者测量会破坏对象时,普查就不现实。例如检验灯泡寿命需要一直点到灯泡损坏,不可能先把所有产品都测坏再出售。
样本的价值就在这里:我们用一部分对象估计整体。代价是样本会波动。即使从同一个总体反复随机抽取 60 人,每次得到的平均通勤时间也不会完全相同。这不是谁算错了,而是抽样本身带来的自然变化。
假设学校在“绿色出行社团”群里收集到 300 份问卷,另一次则从全年级名单中随机抽取 60 人。300 人听起来更有气势,但社团成员的通勤方式很可能和全年级不同。60 人的随机样本反而更有机会对准总体。
样本量主要影响随机波动:在抽样方式合理时,样本越大,结果通常越稳定。代表性主要受选人方式影响:如果某类人很难进入样本,再大的样本也可能稳定地偏向错误方向。

人数多能减少随机摇晃,选得对才能避免方向性的偏差。两件事都重要,作用却不一样。
样本结果只能直接描述样本。要把它推广到总体,必须继续检查抽样范围、抽样方式、未回应情况和测量方法。第 2 页会专门处理这些问题。
通勤调查结束后,样本中 60 名学生的平均单程通勤时间是 31.8 分钟,15 人在过去一周迟到过。于是样本迟到比例是:
31.8 分钟和 25% 都是从样本算出来的数,叫统计量。统计量会随样本改变:换一批 60 人,平均时间和迟到比例很可能跟着变。
学校真正关心的是全部 620 名学生的平均通勤时间和迟到比例。这两个总体中的真实数值叫参数。参数对于这个确定的总体是固定的,只是我们通常不知道它。只要还没有调查全部 620 人,就不能把样本的 25% 直接写成总体参数。
样本统计量的一个核心用途,就是估计总体参数。这里可以用 分钟估计总体均值 ,用 估计总体比例 。但“估计”不是“完全相等”。帽子符号 就像一个提醒:这是我们根据样本得到的估计,不是已经看见的总体真值。
别急着看这个数有没有百分号或小数。先看它描述谁。
这里最容易出现的错误,是把“总体”“参数”都理解成“大”。总体是对象的集合,参数是描述这个总体的数;样本是对象的子集,统计量是从样本算出的数。对象和数字处在不同层次。
统计分析大体上做两类工作。
描述统计负责整理已经观察到的数据。表格、比例、平均数、图形都属于描述工具。它回答的是:“这 60 名学生的记录呈现出什么样子?”
推断统计则从样本走向总体。它回答的是:“根据这 60 人,我们对全部 620 人能说什么?这个估计可能有多大误差?观察到的差异会不会只是抽样波动?”
在通勤调查里,下面两句话只差几个字,统计含义却不同。
在样本的 60 名学生中,25% 过去一周迟到过。
这是描述统计,因为它只说已经观察到的 60 人。
我们估计全年级约有四分之一的学生过去一周迟到过。
这是统计推断,因为它把样本结果推广到了没有逐个观察的总体。第二句话要成立,必须有合理的抽样设计,并说明估计的不确定性。
一项实验想判断某种血管支架能否降低高风险病人的中风风险。224 名病人接受支架和常规医疗管理,227 名病人只接受常规医疗管理。一年内,前一组有 45 人中风,后一组有 28 人中风。
只看“45 和 28”,比较还不够公平,因为两组总人数不同。我们先把人数变成组内比例。
这个结果和“支架应该降低风险”的直觉相反。承认反直觉很重要:数据不会因为研究者期待某个方向,就自动配合那个方向。
到这里,我们完成的是描述:在参加实验的这些病人中,支架组的一年中风比例更高。接下来才是推断问题:7.8 个百分点的差异大到足以排除随机波动吗?实验里的病人能代表哪些人?结果能否推广到其他支架、其他医院、其他类型的病人?
统计学并不是看到差异就宣布答案。它会先认真描述差异,再衡量这种差异是否可能由随机性造成,最后才讨论结论能走多远。
描述统计把已经看见的数据压缩成清楚的图、表和数;推断统计承认我们只看见了一部分,再判断这部分证据能否支持对总体的说法。
一列写着“12、18、25、38、46”,脱离语境几乎什么都说明不了。它可能是通勤分钟数、年龄、温度,也可能是商品价格。单位不同,解释会彻底改变。
读任何数据之前,都应该把下面这些信息补齐。
假设问卷只问“你每天通勤多久”,有人填单程时间,有人填往返总时间。最后算出 42.37 分钟,看起来非常精确,实际却把两种不同含义混在了一列里。小数点后两位没有修复定义问题,只是让混乱显得更正式。
“平均运动时间”“就业率”“治疗有效”“经常熬夜”这类词也一样。看到它们时,要找操作定义:怎样才算运动?就业率的分母是谁?有效是症状减轻还是完全康复?经常是每周几次?
学校可能收到一封很诚恳的邮件:“我每天换乘三次,接驳车对我特别重要。”这条经历是真的,也值得被看见。但它不能单独回答“全年级有多少人需要接驳车”。我们对鲜明的个案记得特别牢,容易误以为它就是普遍情况。
个案能帮助发现问题、理解机制,也能提醒我们新增变量;要估计总体情况,仍然需要一组有代表性的观测。
题目:一篇校园新闻写道:“为了了解本市初中生对校内手机管理规定的看法,研究者从 12 所学校抽取 800 名学生,记录他们是否支持规定、每天使用手机的时长和所在年级。样本中有 488 人支持,因此本市初中生的支持率是 61%。”
请指出个体、变量、变量类型、总体、样本、统计量和参数,并判断最后一句话应怎样改写。
先找研究问题想覆盖的对象。新闻想了解“本市初中生”,所以总体是本市所有初中生。实际进入数据的是从 12 所学校抽取的 800 名学生,所以样本是这 800 人。
每一行记录一名学生,因此个体是每一名学生。“是否支持规定”“每天使用手机的时长”“所在年级”都是变量,每名学生的“支持”“2.5 小时”“八年级”是相应的变量值。
判断变量类型。“是否支持”是名义分类变量;“每天使用手机的时长”是连续定量变量;“所在年级”虽然常写成七、八、九,但它表示有顺序的类别,通常按有序分类变量处理。
计算并识别样本统计量。样本支持比例为 ,所以 61% 是描述这 800 人的统计量。
这道题里真正的难点不是除法,而是给结论划边界。488 除以 800 谁都会算;知道这个 61% 首先属于样本、要代表总体还得检查数据来源,才是统计思维。
错。学生编号、地区代码、满意度编码都可能用数字表示,但加减这些数字没有合理含义。要看数字扮演的是数量还是标签。
错。一行表示一个观测单位,不一定表示一个独立的人。如果同一名学生连续记录 14 天,他会出现 14 行。必须先看数据表的行定义和唯一标识。
错。样本平均数和样本比例是对总体参数的估计。换一个样本,统计量会变;对同一个确定总体,参数不会因为抽了哪批人而改变。
错。大样本通常更稳定,却不能自动消除选择偏差。20 万名自愿点击网页投票的人,可能不如 1000 名从完整名单中合理抽取的人有代表性。
错。样本会自然波动。观察到差异以后,还要判断差异相对于样本量是否足够大,以及研究设计有没有把别的因素混进来。
错。一张图可以准确描述样本,却未必能代表总体;一次观察性调查可以发现两个变量一起变化,却未必能证明一个导致另一个。描述质量和推断范围是两件事。
以后看到“平均值上涨”“多数人支持”“风险降低”“两者相关”这类标题,可以按下面的顺序检查。先别急着接受或反驳,先把缺的信息找出来。
这份检查单不会让你对所有数字都抱怀疑。它的作用恰好相反:把真正可靠的证据和只靠标题制造确定感的数字分开。
这一节建立了一条从现实问题到统计判断的基本路线。
现在我们已经知道一张数据表里“谁是谁”,也知道从样本走向总体会多出不确定性。下一步自然要追问:这些人究竟是怎样进入样本的?数据来自问卷、日常观察,还是研究者主动安排的实验?不同来源会带来不同的偏差,也决定我们能不能谈因果。下一页就从数据的来源与研究设计开始。
某学校想了解全校学生的早餐习惯,从每个年级随机抽取 40 名学生,记录他们当天是否吃早餐、早餐花费和第一节课是否迟到。指出总体、样本、个体、变量和变量值的例子。
一张班级数据表的列名包括“学生编号、身高、兄弟姐妹人数、是否近视、最喜欢的运动、体育锻炼强度(低、中、高)”。分别判断变量类型。
某市从全部出租车司机中随机抽取 500 人,得到他们上个月平均工作时长为 184 小时。研究者想估计全市出租车司机上个月的平均工作时长。这里的 184 小时是什么?研究者真正想知道的数又是什么?
某医院比较两种护理方案。A 方案有 80 名病人,其中 12 人复发;B 方案有 120 名病人,其中 15 人复发。有人看到 12 小于 15,就说 A 方案复发情况更少。这个比较有什么问题?
一个视频平台发起自愿投票,20 万名参与者中有 68% 支持限制短视频使用时长。新闻标题写道:“68% 的市民支持限制短视频。”请写出至少三个需要追问的问题,并给出一个更稳妥的改写。
在通勤调查的 60 名学生中,平均通勤时间为 31.8 分钟。判断下面两句话分别属于描述统计还是推断统计,并说明原因。
研究真正想知道的,是本市所有初中生中支持规定的真实比例 。这个总体参数通常未知,61% 只能用来估计它,不能在没有抽样信息时直接宣布二者相等。
最稳妥的描述是:“在被调查的 800 名学生中,61% 支持这项规定。”如果确认样本抽取合理,再写:“样本结果估计本市初中生的支持率约为 61%,但估计会受抽样波动和调查方式影响。”