上一页我们把总体、样本、个体和变量分清了。但这里还有一个绕不过去的问题:样本到底是怎么来的?
同样是 400 名学生,一份数据可能来自全校名单里的随机抽取,也可能来自朋友圈里愿意点开问卷的人。人数一样,表格也一样整齐,这两份数据替全校学生说话的资格却完全不同。统计最容易制造错觉的地方就在这里:计算通常不会提醒你,数据在进入表格以前已经偏了。
这一页我们用同一个校园睡眠项目串起调查和实验。学校先想知道“本科生中有多少人长期睡眠不足”,又想知道“关闭睡前通知是否真的能增加睡眠时间”。前一个问题要靠有代表性的抽样,后一个问题要靠公平的处理分派。两件事都叫研究设计,但解决的是两种不同的难题。
先记住一句总原则:数据不是因为数量多就有代表性,也不是因为两组有差异就能说明因果。结论能说多远,首先由数据怎样产生决定。
学校准备改版校园 App,希望了解学生睡眠,并测试一个“睡前一小时暂停非紧急通知”的功能。这个项目其实包含两个问题。
第一个问题是描述总体:
本校本科生中,过去一周平均每天睡眠不足 7 小时的比例是多少?
第二个问题是判断因果:
对原本睡眠不足的学生,开启睡前暂停通知功能,会不会增加接下来两周的平均睡眠时间?
这两个问题看起来都在谈睡眠,证据路径却不同。第一个问题要从一部分学生推到全校,核心是样本能不能代表总体。第二个问题要比较“开功能”和“不开功能”会造成什么差别,核心是两组在处理之前是否公平。
我们后面会反复回到这两个问题。先别急着记术语,只要抓住两条路线:
假设学校有 6000 名在读本科生。
抽样框不是总体的另一种叫法。它更像一扇门:总体成员只有先出现在这扇门后面,才有机会被抽中。
如果学籍名单没有更新,漏掉了刚转专业的学生、交换生或暂时休学后复学的学生,那么这些人进入样本的概率就是 0。即使研究者在名单内做了完全随机的抽取,也只能代表“名单覆盖到的人”,不能自动代表原本设定的全部 6000 人。
还有一个经常被忽略的范围:实际回答者。研究者抽了 400 人,可能只有 286 人完成问卷。此时:
后面判断非回应偏差时,恰恰要问这 114 人会不会和 286 名回答者不同。
设总体中睡眠不足 7 小时的真实比例是 ,样本中观察到的比例是 。样本比例是我们看得见的数,总体比例通常看不见,所以才需要抽样。
如果我们暂时知道总体真值,就可以把一次抽样的误差写成:
现实里往往不知道 ,因此也不能直接算出这次究竟偏了多少。这个公式的意义是提醒我们:样本给的是估计,不是总体真值的复印件。
从同一个总体反复随机抽取 400 人,每一次抽到的人都不同, 自然也会不同。一次可能是 38%,下一次可能是 41%,再下一次可能是 39%。这种样本之间的自然波动叫抽样变异,由此带来的偏离叫抽样误差。
这件事第一次听会有点反直觉:一个抽样过程可以完全规范,结果仍然不等于总体真值。随机抽样承诺的是“不长期偏向某一类人”,不是“每次都正好抽成总体的缩小模型”。
样本量增加时,随机波动通常会变小。你可以把它想成多次观察在互相抵消偶然性。但这句话只针对随机误差。名单漏人、问题诱导、特定人群拒绝回答,这些系统性问题不会因为样本变大自动消失。
大样本能把一个有偏结果估得非常稳定。稳定不等于正确:如果只让自愿打开问卷的人回答,十万人也可能只是把“愿意回答者的意见”算得很精确。
抽样方式不是一串要背的名词。它们都在解决同一个现实问题:怎样用有限成本,让样本尽量覆盖总体中重要的差异。
研究者在图书馆门口、食堂出口或自己的课堂里找最容易接触的人,这叫便利抽样。
如果学校只在晚上 10 点的图书馆门口询问睡眠,样本会集中在那时仍在图书馆的人。他们可能更忙、考试压力更大,也可能比普通学生更晚睡。这个样本很适合试运行问卷,却很难代表全校学生。
便利样本的问题来自研究者的接触范围:谁容易被找到,谁就更容易进入样本。
学校在 App 首页挂一条“点击参与睡眠调查”的链接,所有人都能看到,但由学生自己决定是否参加,这叫自愿回应。
这和便利样本不是一回事。便利样本是研究者只接触了方便接触的人;自愿回应是很多人都有机会看到,但态度强烈、时间充足或对主题特别关心的人更愿意回答。
睡眠极差的人可能很想表达困扰,睡眠很规律的人也可能愿意分享经验,处在中间的大量学生反而懒得点开。我们无法只凭回答人数判断这种偏差会往哪个方向走,但可以确定:自愿参加的机制给了某些人更高的进入概率。
如果有一份覆盖完整的 6000 人名单,可以给每人一个编号,再用随机数抽出 400 人。这叫简单随机抽样。
更严格地说,大小相同的每一组 400 人都应有同样机会成为样本。研究者不能根据姓名、院系或个人印象挑选某种组合;最终进入样本的组合由随机机制决定。
简单随机抽样的优点是规则清楚,能减少研究者有意或无意的挑选。它的困难也很现实:需要较完整的个体名单,而且抽中的学生可能分散在不同校区,联系成本不低。
如果年级与睡眠关系很大,而全校四个年级人数又不相同,可以先按年级分层,再在每个年级内部随机抽人。
分层抽样有两个常见目的:
例如按各年级人数占比抽取,总体结果更容易还原全校结构;如果学校还想单独比较每个年级,也可以从每层抽取足够人数,分析时再按总体比例加权。
分层的关键是:每一层都进入样本,而且每一层内部还要随机抽。
如果拿不到完整学生名单,却有全校互不重叠的行政班名单,可以把行政班当作群,随机抽取 12 个班,再调查被抽班级里的所有学生。这叫整群抽样。
整群抽样主要为现实成本服务。研究团队不必在全校四处找人,只需进入少数几个班级或宿舍楼。
它最适合“每个群内部已经很多样、不同群彼此又较相似”的情况。如果某些班几乎全是大一学生,另一些班几乎全是毕业生,而年级又影响睡眠,那么只抽少数班就可能损失很多信息。同一班学生还可能受同一课程表影响,彼此过于相似,实际信息量会比同样人数的简单随机样本少。
这里最容易把分层和整群搅在一起。可以用一句话拆开:
假设名单有 6000 人,计划抽 300 人,那么抽样间隔是 。先在 1 到 20 中随机选一个起点,比如 7,再抽第 7、27、47、67 位,一直抽下去。这叫系统抽样。
它比逐个生成 300 个随机编号更方便,特别适合按顺序经过的对象或很长的名单。但“随机起点”不能省略,否则名单前部的人会有不同机会。
系统抽样还怕周期性。如果名单每隔 20 行就重复一种固定结构,而抽样间隔正好也是 20,样本可能一直落在同一类人身上。使用前要先看名单的排序规则;如果名单按年级、校区或成绩整齐排列,最好先打乱,或改用分层抽样。
没有一种抽样方式在所有场景都最好。分层抽样通常换来更好的子群覆盖,整群抽样通常换来更低的收集成本,简单随机抽样则最容易解释。选择方法时要把代表性、名单条件和执行成本一起看。
即使抽样方法选得不错,调查仍然可能在后续环节偏掉。抽样只决定“邀请谁”,并不保证“谁会回答”或“回答是否准确”。

如果学校只从 App 已激活用户中抽样,没有激活 App 的学生完全进不来,这就是覆盖不足。假如睡眠很差的学生更少登录校园 App,调查会系统性低估睡眠不足比例。
反过来,抽样框也可能包含不属于总体的人。例如名单没有清理已经毕业的学生。覆盖问题的根源不是抽中了谁,而是抽之前的名单边界就没有和总体对齐。
非回应率高不一定必然造成大偏差,关键要看“不回答”是否与研究问题有关。
如果漏接电话与睡眠状况毫无关系,影响可能主要是有效样本变小,随机波动变大。可如果长期熬夜的学生白天更难接电话,或者对睡眠问题厌烦而拒答,那么回答者和未回答者在睡眠上会系统性不同,样本比例就会偏。
提高回应率有很多朴素办法:在不同时间重复联系、提供多种答题渠道、缩短问卷、明确隐私保护、给出不过度诱导的小额补偿。更重要的是记录联系流程和不同群体的回应率,这样才能判断偏差可能藏在哪里。
比较下面两种问法:
为减少熬夜造成的学习损失,你是否支持学校开启睡前通知限制?
你是否支持校园 App 在睡前一小时暂停非紧急通知?
第一种问法把“学习损失”塞进问题里,容易让“不支持”显得不负责任。第二种相对中性,但仍应说明“非紧急通知”的范围,否则不同学生会按不同理解作答。
调查睡眠时,“你是否经常熬夜?”也很模糊。有人把凌晨 1 点算熬夜,有人把 11 点半就算熬夜。更可比的问法是:
过去 7 天中,你通常几点入睡、几点起床?请分别填写上课日和休息日。
这种问法仍可能有记忆误差,但至少把时间范围和记录单位说清楚了。
睡眠时长如果来自手环,设备漏记午睡或把静坐识别成睡眠,也会造成测量误差。数据整理时把“6 小时 30 分”误录为 6.30 小时,则又引入单位错误。设计阶段要提前约定变量定义、缺失值规则和单位,而不是等图表看起来奇怪再猜发生了什么。
下面的实验室固定一个 1000 人总体。先选择“随机样本”,保持回应率 100%,多点几次“重新抽样”,你会看到样本估计围绕真实值上下波动,这就是抽样变异。
接着把样本量调大,随机波动通常会缩小。然后切到“便利样本”或“只从线上名单抽样”:样本量再大,估计也可能围绕一个偏离总体的位置变得稳定。最后降低回应率,观察愿意回答的人怎样进一步改变结果。
交互里的蓝色误差带只描述常规随机抽样下的随机不确定性。它不会自动补偿抽样框漏人或非回应偏差。一个很窄的误差带,完全可能围着一个有偏估计展开。
现在回到校园睡眠项目。学校要估计“过去一周平均睡眠不足 7 小时的本科生比例”,一个可执行的方案可以这样走。
先把总体和时间范围写死。总体是本学期所有在读本科生,研究变量是过去 7 天平均每日睡眠时长,而不是“平时是否爱熬夜”这种没有统一尺度的印象。
再检查抽样框。把学籍名单与当前在读状态核对,删除已经毕业或退学者,补上交换、转专业和复学学生,并确认每人只有一条记录。
选择抽样方式。考虑到年级作息差异明显,可以按年级分层,在每层内随机抽取,并按各年级在总体中的比例分配名额。这样四个年级都有进入样本的机会。
预先写好联系方案。首次邀请后,在不同日期和时段再提醒两次,同时保留网页和短信两种入口。记录每次联系是否成功,而不是只保存最终答卷。
这套流程并不华丽,但每一步都在堵一个具体漏洞。调查质量往往不是靠最后套一个复杂公式救回来,而是靠前面这些看似琐碎的决定积累出来。
学校还想知道:使用“睡前暂停通知”功能的学生,是不是睡得更久。
最省事的办法是查看已有后台记录,把主动开启功能的学生和没有开启的学生放在一起比较。研究者没有安排谁开启功能,只是观察现实中已经发生的选择,这就是观察性研究。
观察性研究并不是“不认真做的实验”。它适合不能操纵、不该操纵或暂时只想了解现实关系的问题。例如我们不能随机要求一部分学生连续失眠,也不能为了研究吸烟而随机让人开始吸烟。观察已有行为、追踪人群或回看历史记录,常常是唯一合理的起点。
当我们怀疑一个变量可能影响另一个变量时,可以先给它们分工:
给变量贴上“解释”和“响应”的标签,只是在说研究问题的方向。它不会把相关关系自动变成因果关系。
假设后台数据显示,开启功能的学生平均多睡 35 分钟。能不能说功能带来了 35 分钟睡眠?还不能。
主动开启功能的人可能本来就更重视作息,也可能已经意识到自己睡眠不足,正在同时减少咖啡、提前写作业。自我管理习惯既影响“是否开启功能”,又影响“最后睡多久”,于是功能效果和原有差异缠在一起。
这种同时关联解释变量和响应变量、让两者关系难以分开的第三个变量,叫混杂因素。

图里的咖啡例子与校园 App 是同一个结构:工作压力可能让人喝更多咖啡,也让人睡得更差;自我管理习惯可能让人开启通知限制,也让人更早睡。只看中间两个变量,我们无法知道观察到的差异有多少来自真正的处理效果。
如果现在招募学生,之后连续记录两周 App 设置与睡眠,这是前瞻性观察:先确定对象,再等待结果发生。
如果直接调取过去一个学期的 App 与手环记录,这是回顾性观察:事件已经发生,再从历史资料中整理变量。
两者都可能做得很细致,也都可能发现稳定关联,但只要处理是学生自己选择的,混杂仍然存在。控制几个已知变量能改善比较,却无法保证所有重要混杂都已被测量。
“开启功能的人睡得更久”是对数据的描述;“开启功能让人睡得更久”是因果判断。中间少的不是一个更漂亮的图,而是一套能把原有差异与处理效果分开的设计。
如果学校真正想知道通知功能是否改善睡眠,就要从观察已有选择,转向主动安排处理。
实验的定义很直接:研究者给参与者分配处理。处理不一定是药物,也可以是学习方法、页面版本、通知策略或运动计划。若分配过程使用随机机制,这就是随机实验。

在校园项目中:
两组结果差异可以先写成:
这里的差异仍会受到随机波动影响,不会每次都等于真实平均处理效果。随机分派的价值是让已知和未知的背景特征都没有固定理由偏向某一组。样本足够大、执行可靠时,背景差异更可能互相抵消。
随机分派不保证这一次的两组年龄、基础睡眠和自律程度一模一样。它保证的是分组规则没有利用这些特征挑人,因此不会系统性地把“更容易改善的人”放进处理组。
“控制”不等于“设一个对照组”这么简单。两组还应使用相同的研究周期、睡眠记录设备、提醒频率和结果计算规则。如果处理组每天得到研究人员关心,对照组两周没人联系,那么最后差异可能混入额外关注带来的影响。
也不能在看到结果后随意更换指标。若一开始说看平均睡眠时长,结果不明显后又改看周末睡眠、主观精神或某一天的最长睡眠,总能撞到一个看似好看的差异。研究开始前应写清主要响应变量、排除规则和分析窗口。
研究者已经知道,实验前睡眠不足 6 小时的人和接近 7 小时的人,改善空间可能很不一样。可以先按基线睡眠分成“严重不足”和“轻度不足”两个区组,再在每个区组内部把一半学生随机分到处理组,另一半分到对照组。
这叫阻断。它确保每种处理都包含相近数量的高风险和低风险参与者,减少一个已知重要变量带来的随机不平衡。
分层抽样和阻断长得很像,都是“先分组,再随机”,但位置不同:
实验设计里的重复有两层意思。
第一层是在一次实验中纳入足够多的独立参与者。如果每组只有 3 人,一个人的突发通宵就可能把平均值拉得很远。参与者增加后,个体偶然波动更容易被平均掉。
第二层是由其他时间、地点或研究团队重新实施整个实验。一次结果可能依赖考试周、某种手机型号或某个校区;独立重复能检查效果是否稳定。
同一个人连续记录 14 晚会提供更完整的个人信息,但这不等于有 14 个独立的人。不能把 30 名学生的 420 个夜晚简单说成 420 名独立参与者。
人知道自己接受了“新功能”,可能因为期待而主动早睡;研究助理知道谁在处理组,也可能在追问睡眠日志时更耐心。这些差异都不是功能本身,却会进入结果。
安慰剂是一种外观和过程尽量像真实处理、但不包含关键成分的对照处理。在 App 研究里,可以让对照组看到同样的安装流程和晚间页面,但不真正暂停非紧急通知。它的目的是让两组都感到自己“参加了一个项目”,从而隔离额外关注和期待。
盲法则控制“谁知道分组”:

不是所有实验都能真正盲。例如学生一定知道自己有没有参加跑步训练,App 用户也可能发现通知是否真的被暂停。此时不要硬说“双盲”,而应尽量让结果测量自动化、让数据分析者看不到组别标签,并给对照组相同的接触频率。
安慰剂也必须服从伦理。如果已有有效治疗,不能只为做出漂亮对照就让患者放弃必要治疗;可以把新治疗与标准治疗比较,或在标准治疗基础上随机增加新处理。
明确研究对象与因果问题。招募当前平均睡眠不足 7 小时、愿意参与两周研究的本科生,主要响应变量定为实验期内每晚平均睡眠时长。
在分组前记录基线。连续记录一周睡眠,同时收集年级、住宿地点和夜间兼职情况。这些数据用于检查平衡或设置区组,不能拿来事后挑出“看起来有效”的人。
按基线睡眠程度阻断,再在每个区组内随机分派。这样严重睡眠不足者不会偶然大量集中在某一组。
处理组启用暂停通知功能,对照组使用外观相同的标准版本。两组的安装指导、研究周期、联系次数和睡眠记录方式保持一致。
这是整页最容易混的一对概念。
随机抽样发生在总体到样本之间。它问的是:哪些人进入研究?主要帮助样本代表总体。
随机分派发生在样本到处理组之间。它问的是:进入研究的人接受哪种处理?主要帮助各组公平比较。
可以把研究路径画成一句话:
总体经过随机抽样得到样本,样本再经过随机分派进入不同处理组。
两次随机都做到当然很好,但现实中经常只做到其中一个。结论范围要跟着设计走。
如果参与实验的人全是主动报名的高年级学生,即使随机分派做得很好,实验仍主要告诉我们“这个功能对这些参与者有什么效果”。大一学生、走读生或不愿安装 App 的人是否有同样效果,还需要额外证据。
代表性也不是要求样本在每个细节上都与总体完全相同。随机样本本来就会波动。我们关心的是进入机制有没有系统性漏掉某些类型,而不是一次样本是否恰好复刻了所有总体比例。
随机抽到 400 名很有代表性的学生后,如果仍让他们自己决定是否开启功能,那么自我管理习惯仍会混杂比较。代表性再好,也没有解决因果问题。
反过来,从一个社团招募 80 人并随机分派,可以在这个社团成员中做公平的因果比较,但不能仅凭随机分派就宣布全校 6000 人都会得到同样效果。
判断结论范围时分两次问:样本怎样进入研究,决定结果能推广给谁;处理怎样进入样本,决定差异能否解释为因果。把这两问分开,很多新闻标题里的跳步就会立刻显出来。
一次随机抽取可能碰巧抽到较多大一学生,或较多睡眠不足者。这不代表随机抽样失效,而是抽样变异的正常表现。判断方法是否合理,要看产生样本的机制,而不能只因为结果“不顺眼”就重抽。
如果研究者不断重抽,直到得到自己期待的比例,随机机制反而被破坏了。
研究者可以精心挑出 50 名自律学生放进处理组,再挑 50 名普通学生放进对照组。人数完全相等,比较仍然不公平。随机分派关心的是分组规则,不只是组的大小。
观察性研究可以用统计方法调整年级、性别和基线睡眠,但未记录的考试压力、自控力或家庭环境仍可能影响结果。“已控制所有能想到的变量”不能证明没有遗漏。
没有对照组时,即使处理后睡眠增加,也不知道是功能有效,还是考试周结束、天气变凉、学生习惯了手环,或者睡眠本来就会回升。对照组给出了“没有关键处理时会怎样”的参照。
随机分派后,如果处理组大量退出、对照组偷偷使用同类功能,或者测量设备只在一组频繁故障,公平的起点会被后续执行破坏。研究设计必须从招募一直管到测量和分析。
学校想了解全校 6000 名本科生的睡眠状况,从“已绑定校园 App 的 5100 名本科生”名单中随机抽取 400 人,最后 278 人完成问卷。请分别指出总体、抽样框、被抽中样本和分析样本,并说出一个风险。
研究者从每个年级随机抽 75 人,这是什么抽样?研究者随机抽 10 个班,再调查这 10 个班的全部学生,又是什么抽样?两者的目的有何不同?
一份名单按“20 人一个宿舍单元”重复排列,每个单元第 1 人都是楼层负责人。研究者随机从前 20 人中选到第 1 人,之后每隔 20 人抽一位。这个样本有什么问题?
同一份完整名单上做两次简单随机抽样,睡眠不足比例分别是 38% 和 42%。这说明至少有一次抽错了吗?如果把样本从 200 人增加到 800 人,什么问题更可能改善,什么问题不会自动改善?
后台数据显示,主动开启睡前暂停通知的学生平均多睡 35 分钟。指出解释变量、响应变量和一个可能的混杂因素。这项研究最稳妥的结论是什么?
研究团队招募 240 名睡眠不足的学生,想测试暂停通知功能。请写出处理组、对照组、一个阻断变量、盲法安排和响应变量。
研究者先在自己的统计课上招募 80 名志愿者,再随机把一半分到处理组。若处理组睡眠明显增加,这项研究能证明什么,又不能直接推广到哪里?
一篇报道写道:“对 5 万名用户的分析证明,使用睡眠 App 会让人睡得更久。”你至少要追问哪四件事?
现在我们可以把研究设计压缩成一条检查路线:
这套检查不会替你算出一个百分比,却决定那个百分比有没有资格代表别人,也决定一张组间差异图能不能被读成因果。
下一页我们假设数据已经通过了这些来源检查,正式打开数据表。第一步仍然不是立刻算平均数,而是先做频数表、条形图、直方图和散点图,看看分布的形状、异常值和变量关系。研究设计回答“数据为什么值得看”,图表探索接着回答“这些数据到底长什么样”。
把问卷先给一小组学生试填。检查“入睡时间”“起床时间”“午睡”是否会被误解,确认跨过午夜时长能正确计算,再正式发放。
分开报告抽中人数、有效回答人数和回应率。如果不同年级回应率差异很大,要说明这一限制,不能只展示最后的样本比例。
最后才计算 。报告时先说“样本中睡眠不足的比例”,再依据抽样框、抽样方式和非回应情况,判断它能否推广到全校本科生。
尽可能实施盲法。参与者盲法若无法做到,就至少让负责清理手环数据和计算结果的人看不到分组标签。
追踪退出和未遵从。有人被分到处理组却手动关闭功能,有人中途不再上传数据,这些情况都要记录,不能只留下“最配合”的参与者。
按预先确定的规则比较两组平均结果,并报告不确定性。若处理组平均睡眠更长,随机分派才让我们有理由把差异主要归因于功能,而不是学生原本更自律。