上一节里,我们用置信区间给未知参数圈出了一段合理范围。现在把问题换一个方向:如果有人先提出一个明确说法,样本数据能不能把这个说法推翻?
这类问题在生活里到处都是。一个按钮的报名率从 变成 ,到底是改版有效,还是刚好分到了一批更愿意报名的人?一种新药的改善率比安慰剂高 个百分点,是疗效,还是几百人的样本波动?某城市今年的平均通勤时间多了 分钟,是交通真的变差了,还是这次抽到的人碰巧住得更远?
显著性检验不会直接宣布哪一种解释“绝对正确”。它做的是一件更克制的事:先把“没有真实差异”当作基线,再衡量眼前的数据离这条基线有多远。 如果在基线世界里,这么远的结果很少见,我们就有理由怀疑基线;如果并不少见,证据就还不够。
这个过程经常得出反直觉的结论。样本里明明有差异,检验却可能说证据不足;p 值明明只有 ,结论也不等于“已经证明有效”。这一章的目标不是让你机械套公式,而是把这些容易拧巴的地方一件件想顺。

检验统计量把“离原假设多远”换成统一尺度;p 值则把同样极端或更极端的尾部概率加起来。
我们先看一个贯穿全章的 A/B 测试。某学习网站把访客随机分到两个版本:
样本里 B 比 A 高 个百分点。这是已经看到的事实,不需要检验。但团队真正关心的不是这两万名访客,而是这次实验覆盖机制下的目标访客面对两个版本时的真实报名率:也就是有机会进入网站、符合实验纳入规则并能被同一套系统随机分流的那类访客。把两个版本在这个目标总体中的报名率分别记作 和 ,研究问题就变成了: 是否真的不等于 ?
原假设记作 。它通常写成“没有差异”“没有效果”或“总体参数等于某个基准值”。A/B 测试的原假设是:
这句话不是说我们已经相信两个版本完全一样。它只是搭起一个可计算的世界:假如两个版本真实报名率相同,那么随机分组会制造出多大的样本差异? 后面所有“意不意外”的判断,都先在这个世界里进行。
备择假设记作 。如果实验前只想判断两个版本是否不同,不管谁高谁低,就写成:
这是双侧检验,因为正方向和负方向都算与 相矛盾的结果。B 明显更好值得发现,B 明显更差也不能装作没看见。
如果产品团队在实验前就有充分理由只关心“B 是否更高”,也可以写成:
这是一项右侧检验。相应地,质量检查若只关心不合格率是否超过上限 ,会写成 ;若只关心一种治疗是否降低复发率,则可能写成 。
单侧还是双侧,必须在看最终数据前决定。看见 B 更高以后才把双侧改成右侧,会少算另一边同样极端的结果,人为压低 p 值。更麻烦的是,如果数据意外显示 B 有害,原先的右侧检验不能临时掉头去追这个方向。医学和安全问题通常更适合双侧检验,因为反方向的伤害也需要被发现。
另一个常见错误,是把已经知道的样本数字写进假设。例如写成 没有什么可检验的:这只是样本事实。假设要谈未知的总体参数,例如总体比例 、总体均值 、总体比例差 或总体均值差 。
研究问题、参数和假设之间应该能一口气读下来:我们想知道实验覆盖的目标访客在 B 版本的真实报名率是否与 A 不同,所以参数是 ,基线是差值为 ,备择是差值不为 。若要把结论继续推广到未来,还要额外相信访客构成、季节、流量渠道和页面运行系统没有发生足以改变效果的变化;显著性检验本身不会替我们保证这种稳定性。
只说“相差 个百分点”还不够。若每组只有 人,这点差异小得几乎看不出来;若每组有一百万人,同样的差异可能远超普通随机波动。我们需要拿观察到的差异去除以它在 下通常会波动的尺度:
这就是“离原假设多远”的统一刻度。统计量为 ,表示样本估计正好落在原假设值上;统计量为 ,表示它离原假设大约两个标准误;统计量为 ,表示它在相反方向上离了三个标准误。正负号告诉我们方向,绝对值告诉我们距离。
为什么要除以标准误?因为 分钟的差异放在“每次波动只有 分钟”的研究里很醒目,放在“每次波动有 分钟”的研究里就很普通。标准误把研究本身的噪声算进来了,让不同单位、不同样本量的问题可以用同一种距离直觉理解。
检验一个总体比例是否等于 时,在 下使用:
这里特意使用 ,而不是样本比例 。原因很直接:检验正在问“如果 成立,样本会怎样波动”,所以标准误也要从 给定的比例出发。
比较两个比例,且原假设是 时, 认为两组共享同一个比例。我们把两组成功数合在一起估计它:
对应的检验统计量为:
检验总体均值是否等于 时,总体标准差通常未知,只能用样本标准差 估计。因此我们使用尾部稍厚的 分布:
单样本均值检验的自由度通常为 。样本越小, 对总体波动的估计越不稳定, 分布的尾部就越厚;样本增大后,它会越来越接近标准正态分布。
公式不会替我们修复坏数据。比例的正态近似检验通常要求观察彼此独立,并且在 下每组预期的“成功”和“失败”数量都不能太少,常用的入门检查线是至少 。均值的 t 检验同样需要独立观察;小样本还要特别留意明显偏斜和离群点,大样本虽然更耐受偏斜,也不能无视极端离群值。
随机抽样帮助我们把结论推广到目标总体,随机分组帮助我们解释因果。两者解决的不是同一个问题。如果网站只让新用户看 B、老用户看 A,即使公式给出很小的 p 值,我们也分不清差异来自页面还是用户构成。
检验统计量只量化模型所描述的随机波动。选择偏差、混杂、重复记录、测量错误和不恰当的停止规则,不会因为除了一次标准误就自动消失。
p 值最准确的定义是:
在原假设成立,并且检验模型的条件也成立时,得到当前这么有利于备择假设、或更加极端的检验统计量的概率,就是 p 值。
用条件概率的形式写,就是:
注意条件写在竖线右边:我们暂时把 当真,再问这样的数据有多少见。p 值不是下面这个概率:
这两个问题看起来只是把左右对调,含义却完全不同。就像“下雨时地面湿的概率”不能直接倒过来当成“地面湿时一定下过雨”,因为洒水车也会让地面变湿。
若 ,更大的统计量更支持备择,p 值取右尾面积;若 ,p 值取左尾面积。若 ,正负两个方向都算偏离,p 值要包含两侧同样远或更远的尾部。
以 为例,右侧单尾面积约为 ;双侧检验还要把左边 的同等极端结果算进去,所以 p 值约为 。这就是为什么同一份数据采用单侧或双侧会得到不同 p 值,也说明为什么方向不能事后挑。
假设双侧检验得到 。准确说法是:如果 成立且模型合适,重复进行同样的研究,得到当前这么极端或更极端统计量的概率约为 。
它不表示:
p 值衡量的是数据与一个指定原假设之间的不相容程度,不是给所有解释排出概率。数据造假、实验偏差、模型失配和真实效果都可能让数据显得与 不相容,单独一个 p 值分不开它们。
显著性水平记作 。它是看数据前定下的决策阈值。常见的 不是自然界的一条分界线,也不是“可信度必须达到 ”,而是一条人为选择的长期错误控制规则。
在一套满足条件的检验中,如果 真的成立,我们仍可能因为随机波动得到很极端的样本。把规则设为 ,意思是长期反复使用这套规则时,第一类错误率不超过约 :
为什么这里一般写“小于或等于”?像二项计数这样的离散数据,只能取若干个跳跃的结果,拒绝域未必刚好凑出 的概率,实际错误率可能更小。对连续分布、临界值又能精确校准的简单检验,等号有时成立。无论是哪种情况, 表示事前承诺的上限,不是数据算出来的“原假设出错概率”。
做决定时比较 p 值与 :
第二句话故意写得有点绕,因为“不能拒绝”确实不等于“接受”。法庭里证据不足以定罪,不等于已经证明被告绝对无辜;小样本里没有检出差异,也不等于真实差异严格为零。
如果 , 会落在“拒绝”一边, 会落在“不能拒绝”一边。但这两个 p 值表达的证据强度几乎一样。把前者写成“确定有效”、后者写成“完全无效”,是在让一条方便决策的线冒充自然界的断崖。
更诚实的报告方式是同时给出 p 值、效应大小和置信区间。例如:“估计提升 个百分点,95% 置信区间约为 到 个百分点,双侧 。”读者可以看出证据刚刚越过预设门槛,区间也靠近 ,而不是只看到“显著”两个字。
是事前规则,p 值是事后由数据算出的连续证据指标。不要把 p 值写成只有“过线”和“没过线”两种状态,更不要把 解释成结论为真的概率。
回到开头的数据。A 版本 人中有 人报名,B 版本 人中有 人报名。假设访客在实验开始时被随机分流,主要指标和实验时长也提前确定。我们使用双侧检验,显著性水平为 。

先把研究问题落到总体参数。我们关心实验覆盖机制下目标访客在两个版本中的真实报名率差 ,所以写出 与 。双侧意味着 B 更好或更差都不能忽略。
这个例子还有一个容易忽略的前提:实验不能每天看一次 p 值,一到 以下就停。反复查看相当于给随机波动很多次“撞线机会”,实际第一类错误率会高于原先承诺的 。若确实需要连续监控,就要预先使用适合序贯实验的规则,不能把普通固定样本检验原样照搬。
即使这次随机实验内部做得很好,结论最直接支持的仍是实验覆盖机制下的目标访客。若未来访客来自不同地区,节假日改变了访问动机,广告渠道换了一批人,或者报名系统本身被改动,效果都可能变化。把这次结果推广到未来,需要这些关键条件大体稳定,并最好在新的时间窗口复验。
假设一项随机、双盲、安慰剂对照实验招募了 名符合条件的患者。药物组 人中有 人明显改善,安慰剂组 人中有 人明显改善。主要结局、分析方法和 都在研究开始前确定。
这次仍做双侧检验,因为新药可能更好,也可能更差:
随机分组让两组具有可比性,双盲减少治疗期待和结果评估带来的偏差。每名患者只在一组中出现。在 下,两组预期改善人数和未改善人数都大于 ,可以使用两比例 z 检验。
样本改善率分别为:
现在还不能直接宣布药物应该投入使用。我们需要知道“明显改善”怎样定义、随访是否完整、不良反应有多严重、样本能否代表目标患者、改善能维持多久,以及其他研究能否重复这个结果。统计检验处理的是随机波动,不会替医学判断做完后面的工作。
只要根据随机样本做决定,就有可能出错。真实世界有两种状态,检验也有两种决定,组合起来是四种情况:
在药物例子里,第一类错误是药物其实没有改善作用,我们却把随机差异误认成疗效;第二类错误是药物确实有效,研究却没有检出足够证据。
把 从 降到 ,拒绝 需要更极端的数据,第一类错误会减少。但在样本量不变时,真实效果也更难跨过门槛,第二类错误往往增加。反过来,提高 会更容易发现效果,也会制造更多假阳性。
所以阈值要结合后果来选。把无效药误判为有效可能带来严重副作用,就需要更严格的第一类错误控制;一种低成本筛查若漏掉疾病的后果很重,研究设计则要特别关心第二类错误。这里没有脱离情境的万能数字。
第二类错误概率常记作 ,检验功效定义为:
它表示在某个具体的真实效果大小下,检验能够拒绝 的概率。功效不是一项研究固定不变的标签:真实提升若只有 个百分点,可能很难发现;若提升有 个百分点,同一研究的功效会高得多。
通常,下列变化会提高发现真实效果的机会:
样本量规划不能只问“多少人才容易显著”。研究开始前应先规定最小实际重要差异,再结合可接受的第一类错误率、目标功效和数据波动,估算需要多少观察。这样得到的样本量是在回答现实问题,而不是保证产生一个好看的 p 值。
小样本没有显著结果时,先看置信区间。如果区间既包含“几乎没有效果”,也包含“很有价值的效果”,这项研究不是证明了无效,而是信息还不够精确。要主张两种方案足够接近,需要专门设计等效性或非劣效性检验,不能靠普通检验的“不显著”代替。
p 值同时受效应大小和样本量影响。样本特别大时,微小到几乎无关紧要的差异也可能得到很小的 p 值;样本很小时,一个实际看起来不小的差异又可能因为标准误太大而没有显著。
假设某平台有数百万用户,改版把平均停留时间从 分钟提高到 分钟。只要样本足够大,这 分钟也可能统计显著。但它只有 秒,是否值得投入研发、是否改善学习效果,是另一个问题。
反过来,一项早期罕见病试验估计症状缓解率提高 个百分点,却因为样本很少得到 。我们不能说“没有效果”,也不能跳过不确定性说“一定有效”。更有用的信息是效应估计、置信区间和追加数据的计划。
所以报告检验结果时,至少把三件事放在一起:
统计显著回答“随机波动是否容易解释这个结果”,实际重要回答“效果是否大到值得行动”。两者都要回答,但不能互相冒充。
如果只做一次检验,并把 设为 ,在 成立时误报概率约为 。但如果同一份数据上独立检验 个完全无效的指标,只要有一个 p 值小于 就宣布发现,至少出现一次假阳性的概率是:
也就是约 。这不是公式失效,而是研究者悄悄把“一次机会”变成了“二十次机会”。
类似问题还包括:同时比较很多用户分组,只报告显著的那个;试了多个终点,挑 p 值最小的一个;看到数据后改变排除规则;今天不显著就继续收集,明天显著便停;先看结果,再编一个像是事前提出的假设。这些做法会让报告中的 p 值比真实证据更漂亮。
入门阶段先记住三个防线:
“我们测了 30 个指标,其中一个 ”和“我们事前只指定这一个主要指标,得到 ”不是同等强的证据。p 值的解释离不开它是怎样被挑出来的。
前面的两个完整例子都在比较比例,但同一套思路可以迁移到均值。真正稳定不变的是:确定参数和假设,检查数据来源与模型条件,用标准误把差异标准化,从对应分布求尾部概率,再回到现实问题解释。
若一条生产线声称次品率为 ,抽取 件产品后观察到样本次品率 ,检验 时使用:
这里用 检查 下的预期成功、失败数并计算标准误。如果预期次品数太少,正态近似会失真,应考虑精确二项方法,而不是硬套 z 公式。
A/B 测试和药物改善率都属于这一类。在 下用合并比例构造标准误,因为原假设说两组共享一个比例。构造差值的置信区间时却通常不用合并比例,因为区间不是先假定两组相等,而是在估计差值本身。这两个公式看着相似,用的比例不同,背后的提问也不同。
若包装机目标平均灌装量为 克,抽取 袋得到均值 、样本标准差 ,检验:
检验统计量为:
它仍然是在算“观察均值离原假设几个标准误”,只是因为总体标准差未知,尾部概率从自由度为 的 t 分布中取得。
同一名患者治疗前后各测一次血压,两个数共享同一个人的体质、年龄和生活习惯,不能当成两个独立样本。先为每个人规定统一的相减顺序,例如:
随后只分析这 个差值:
这在数学上就是一次单样本 t 检验。配对的价值在于先扣掉许多个体间的固定差异,让问题集中在“同一个人改变了多少”。但配对关系必须真实存在,不能为了让 p 值变小随意把两组人凑成对。
若比较随机分到两种教学法的两组学生,且每名学生只接受其中一种教学法,参数是 。常见的标准误为:
自由度通常交给软件按两组样本量和方差计算;手算时可以采用保守近似。这里既要检查每组内部的独立性,也要确认两组彼此独立。若其实是同一批学生的前后测,就应该回到配对差值,而不是使用独立双样本检验。
可以把选择方法时最关键的分岔压缩成一句话:结果是类别就看比例,结果是数值就看均值;同一对象被测两次就看配对差,来自不同对象就看独立两组。选对结构以后,后面的“估计值减原假设值,再除以标准误”仍然是同一件事。
第 5 页用散点图和相关系数描述两个数值变量怎样一起变化。若进一步拟合总体直线 ,常见检验是 ,统计量仍是“样本斜率减去 ,再除以斜率标准误”。小 p 值支持目标总体中存在非零线性关联,却不会自动把关联变成因果;抽样方式、离群点、非线性和混杂仍要回到第 5 页的检查中。
两个比例可以用 z 检验比较,可一旦类别多起来,逐对比较会变得笨重,还会制造多重比较问题。卡方检验把整张频数表一次放进同一个问题:实际观察到的各格人数,与 认为应该出现的人数,相差得是否太大?
卡方检验处理的是计数,不是百分比本身,也不是每个个体的数值大小。它有两种最常见的用法。
掷一枚六面骰子 次,若骰子公平,六个点数的期望概率都应为 ,每一类的期望频数就是 。拟合优度检验比较六个观察频数与这六个期望频数:
若指定分布中的概率事先完全给定,有 个类别时,自由度通常是 。如果某些概率参数先由同一份数据估计,自由度还要扣掉估计的参数个数,不能照搬 。
独立性检验从同一个总体抽样,同时记录两个分类变量,例如“使用设备”和“是否报名”,问它们是否有关。若二者独立,知道一个人的设备类型,不会改变对其报名概率的判断。
同质性检验则从几个总体或处理组取得样本,问各组的分类结果分布是否相同,例如三种教学法的成绩等级比例是否一致。两种问题的数据来源和措辞不同,计算使用的列联表公式却相同。
对于一个 行、 列的表, 下第 行第 列的期望频数为:
卡方统计量把每一格的偏离加起来:
是观察频数, 是原假设下的期望频数。平方让正负偏离都产生贡献,除以 则让同样相差 人在“大格子”和“小格子”里得到不同分量。独立性或同质性检验的自由度为:
不会是负数;它越大,整张表与 的期望格局越不相容。卡方检验通常只看右尾。
每个观察单位应只给表中一个格子贡献一次,随机抽样或随机分组应与研究目标相符,而且不应有未处理的家庭、班级等聚类。正态近似比例检验看成功与失败数,卡方近似则看每格期望频数。入门阶段可以采用保守规则:所有 都至少为 。若小格子太多,应考虑合并有实际意义的类别、收集更多数据或使用精确方法,不能为了过条件随意拼接无关类别。
某网站随机抽取 名目标访客,得到下表:
我们检验设备类型与报名是否独立。
写出假设。 是“在目标访客中,设备类型与是否报名独立”; 是“二者有关联”。这不是在检验手机报名率和电脑报名率是否恰好等于某个外部数字。
整体显著以后,还要问差异主要在哪里。每格的 Pearson 残差为:
手机报名格的残差约为 ,电脑报名格约为 ,说明观察数据中手机报名少于独立模型的期望、电脑报名多于期望。各格的 还能直接告诉我们哪些格子为总 贡献最多。
但“有关联”仍不等于“设备导致报名变化”。若这只是观察数据,设备类型可能同时带着年龄、访问场景或流量渠道差异。效果大小也不能只看 p 值; 表可报告两组比例差、优势比,或用 Cramér 的 概括表的关联强度。本例:
这个数要结合应用背景解释,不能只靠固定标签说“大”或“小”。
一枚六面骰子掷 次,点数 到 的观察次数分别为 。请计算拟合优度检验的 和自由度,并说明能否据此怀疑骰子不公平。
若有三种教学法,分别做三次两样本 t 检验,会重复使用同一批数据,并抬高至少误报一次的概率。单因素方差分析,简称单因素 ANOVA,先做一个整体问题:各组总体均值是否全部相同?
假设有 组,总体均值为 。原假设是:
备择假设不是“所有均值两两不同”,而是:
因此,ANOVA 显著只能先推翻“全部相等”,不能单凭整体 p 值说第几组高于第几组。
即使各组总体均值相同,样本均值也会有一点差异。ANOVA 把总变异拆成两部分:
把平方和除以各自自由度,得到组间均方和组内均方:
检验统计量是:
若 成立,组间与组内都主要在反映同一种随机噪声, 通常靠近 。组间均值分得远、组内数据又很紧时, 会变大,因此 ANOVA 也只看右尾。它有两个自由度:分子自由度 ,分母自由度 。
经典单因素 ANOVA 通常要求观察在组内和组间独立,来自随机样本或随机分组;每组分布没有严重偏斜和极端离群点;各总体的组内方差大致相近。组大小接近时,它对轻微非正态和方差差异比较耐受,但严重失衡、明显异方差或离群点仍会扭曲结果。方差差异明显时,可以考虑 Welch ANOVA;数据结构是重复测量或配对时,则不能把同一个人的多次观察当成独立组。
假设三种教学法各随机分到 名学生,测验成绩为:
总均值为 。组间平方和是每组人数乘以组均值与总均值的平方距离:
每组内部三个数都离本组均值 分,所以每组组内平方和是 ,三组合计:
这里 、,所以:
在分子自由度 、分母自由度 的 F 分布下,右尾 p 值约为 。若研究设计和模型条件可信,可以拒绝三组总体均值全部相等的假设。
这个微型数据只是为了让平方和看得见。每组只有 人,实际研究很难靠这么少的数据判断正态性、离群点和方差稳定,不能因为算出漂亮的 F 值就跳过条件检查。
整体 ANOVA 显著只说明至少一组均值不同。若要知道是 A 与 B、A 与 C,还是 B 与 C 不同,需要进行预先计划的对比,或使用 Tukey 等控制多重比较错误率的事后方法。不能在看到数据后把所有成对 t 检验都做一遍,再只报告最小的 p 值。
同时还应报告各组均值、置信区间和实际差异。效应大小可以用 等指标表达“总变异中有多少与分组有关”,但在观察研究里,这仍是关联大小,不会自动排除混杂或证明因果。
三种复习方法的样本平均分分别是 。整体单因素 ANOVA 得到 、,事前设定 。下面三句话中,哪些能由这个结果直接支持?
错。p 值的条件是 成立,输出是数据至少这么极端的概率。它没有计算 本身的概率。
错。没有拒绝 只表示证据不足。样本太小、噪声太大或检验功效不足,都可能让真实差异没被发现。
错。大样本能让很小的效果也得到很小的 p 值。看实际大小要读效应估计和置信区间。
错。 与 的证据强度几乎没有差别。刚过线的发现尤其值得复验,而不是用“显著”遮住不确定性。
也不够。随机分组是强有力的前提,但还要检查失访、未按分组执行、结局选择、重复检验和数据质量。检验模型只在研究过程可信时才有意义。
某学校过去的期末通过率是 。学校随机抽取参加新复习课的 名学生,其中 人通过。若学校在课程开始前只关心新复习课能否提高通过率,请写出参数、原假设和备择假设,并说明应使用哪一侧检验。
一次双侧检验得到 ,显著性水平是 。请解释 p 值并给出决定。
两项设计和样本量几乎相同的研究,p 值分别为 和 。某人说第一项“证明确有作用”,第二项“证明完全没有作用”。这句话哪里错了?
一种快速传染病检测以“没有感染”为 ,“已经感染”为 。分别解释第一类错误和第二类错误。若漏诊的后果特别严重,研究设计还应关心什么?
研究者记录同一批 名患者服药前和服药四周后的收缩压,想判断平均血压是否变化。应该使用配对检验还是独立双样本检验?请写出差值和假设。
某团队在一次没有任何真实改版效果的实验中检查 个彼此独立的指标,每个都以 检验。只要任意一个指标显著就宣布改版有效。至少出现一个假阳性的概率约是多少?
某应用把通知文案改版后,平均每日使用时长增加 分钟,样本量为 万,得到 。产品经理说:“p 值非常小,所以用户体验提升很大,应该立刻上线。”请评价。
现在回头看这门课走过的路,会发现显著性检验不是最后突然多出来的一套仪式。它只是把前面的每一环扣得更紧。
一项判断首先从数据从哪里来开始。是随机抽样、随机分组,还是方便取得的一批记录?观察单位是谁,有没有重复、失访或测量偏差?这一步决定结论能推广给谁,也决定能不能谈因果。来源站不住,后面的精确小数只是在把偏差算得很漂亮。
接着要描述真正看到的样本。看分布、中心、离散程度、比例和离群点,把 与 、均值差 分钟这类观察事实说清楚。描述统计回答“这批数据是什么样”,不会越权把样本差异直接宣布成总体规律。
然后才轮到概率模型。我们把重复抽样想象很多次,用二项、正态、t、卡方或 F 分布刻画统计量的随机波动,用标准误、期望频数以及组内变异说明样本结果通常会晃多远。概率不是装饰,它是从一次样本跨向未观察总体的桥。
有了这座桥,统计推断才开始工作。置信区间给出与数据相容的参数范围;显著性检验暂时采用一个原假设,把观察差异变成 z、t、 或 F 等能与原假设分布比较的统计量,再用 p 值衡量它有多意外。两种方法都在提醒我们:样本给的是证据,不是真值本身。
最后回到现实判断。一个结果即使统计显著,也要看效应有多大、区间有多宽、错误代价是什么、是否做了多重比较、能否重复,以及行动的成本和风险。一个结果若不显著,也要问研究是否有足够功效,不能顺手把“没发现”改写成“并不存在”。
所以,从拿到一份数据到做出决定,完整的思路不是“算出 p 值,低于 ,结束”,而是沿着一条不能跳步的链走下去:可信的数据来源,让描述有对象;清楚的描述,让概率模型有落点;合适的概率模型,让推断有尺度;诚实的推断,才让现实判断知道自己有多大把握。
检查数据来源和近似条件。随机分流让两组在实验开始时具有可比性;每名访客只进入一个版本,而且假设没有同一家庭、团队或营销渠道形成的明显聚类,也没有一个访客看到某版本后去影响另一名访客的报名决定,因此可以把观察近似看作独立。在 下,两组使用共同报名率,预期报名和未报名人数都远大于 ,正态近似没有小计数问题。
先描述样本里实际发生了什么:
因而 B 比 A 高 ,也就是 个百分点。每一万名访客大约多 次报名。
在 下,两个版本共享同一个真实报名率。把两组数据合起来估计这个共同值:
用合并比例计算 世界中两组差值的标准误:
也就是说,如果两个版本其实一样,两个样本报名率之差的典型波动尺度约为 个百分点。
把观察到的差异换成“离 几个标准误”:
B 的样本优势离“真实差值为 ”大约两个标准误。
双侧检验把正负两个方向的同等极端结果都算进去,得到 。准确解释是:如果两个版本真实报名率相同,且随机分流与模型条件成立,观察到至少相差 个百分点这么极端的样本结果,概率约为 。
因为 ,按事前规则拒绝 。数据对“两个版本完全没有差异”提供了反证,但证据只是刚刚越过门槛,不能写成“B 已被证明必胜”。
最后看实际大小。检验和区间在这里要使用不同的标准误。检验暂时采用 ,所以前面使用合并比例;置信区间是在估计未知差值,不先假定两组相等,因此使用两组各自的样本比例:
本例中合并标准误与非合并标准误四舍五入后碰巧都约为 ,但概念和一般公式并不相同。差值的近似 95% 置信区间为:
换成百分点,大约是提升 到 个百分点。区间告诉我们,效果可能很小,也可能足够可观。是否上线还要结合每次报名价值、改版成本、护栏指标和复验结果。
观察到的绝对差异为 ,即每 名患者约多 人改善。
在 下估计共同改善率:
标准误为:
因而检验统计量为:
双侧 p 值约为 。如果新药与安慰剂真实改善率相同,在同样条件下得到当前这么大或更大的双向差异,概率约为 。因为 ,拒绝 。
用未合并的两组样本比例估计差值的置信区间,近似得到:
数据相容的真实改善优势大约为 到 个百分点。这个范围比“p 值显著”更接近临床真正要讨论的问题。
| 对应的真实效果存在 |
| 第二类错误,假阴性 |
| 决定正确 |
在独立假设下计算期望频数。手机且报名这一格为:
同理,手机未报名为 ,电脑报名为 ,电脑未报名为 。四格期望频数都大于 。
计算四格贡献并相加:
这是 表,所以自由度为 。在自由度为 的卡方分布下, 的右尾概率约为 。若 ,拒绝独立假设,数据支持设备类型与报名有关联。
六类概率事先给定,所以 。 在自由度为 的分布中并不极端,p 值约为 ,不能拒绝公平骰子的假设。这不等于证明骰子绝对公平,只表示这 次结果与公平波动很相容。
因为事前研究问题只关心“是否提高”,所以使用右侧单样本比例检验。若学校关心通过率是否发生任何改变,包括变差,就应把备择写为 ,并使用双侧检验。
分析对象是 个个体差值,不是把前后共 个数当成彼此独立的观察。若只关心血压是否下降且方向事前确定,备择也可以写成 。
也就是约 。团队需要事前指定主要指标,并对多重比较作适当校正;探索出来的结果应在新数据中验证。