上一节留下了一条很重要的顺序:先审数据是怎么来的,再看数据说了什么。现在假设研究设计没有明显问题,记录也已经拿到手,下一步不是立刻按计算器,而是先把数据画出来。
这一步看起来简单,实际上很容易翻车。同一组数据换一种画法,可能显得差异巨大,也可能显得什么都没发生;直方图的分箱宽一点还是窄一点,甚至会改变你对“几个高峰”的判断。图表不会自动说真话,它只会把制作者选定的角度放大给你看。
所以这一节不只是教“哪种数据配哪种图”,还要建立一套防误导的读图顺序。我们会一直使用一份“学习状态记录”作为主线:24 位同学各自记录了主要学习地点、当天是否完成计划、课后自主学习时长和次日小测分数。类别变量和数值变量都在同一批记录里,正好可以看到同一份数据如何随着问题变化而换图。
拿到数据后先做三件事:认清变量类型,画出合适的图,按“形状、中心、离散、异常值”描述。数字摘要要放在这三步之后,因为图像会告诉我们哪些数字值得算、哪些数字可能被偏态或异常值牵着走。
选图表之前,不妨先把问题翻译成一句很朴素的话:我是在数类别、看一组数字、追踪时间,还是比较两个数字?
同一个变量可能因为问题不同而换图。比如“当天学习了几小时”是数值变量:想保留每个学生的准确时长,可以用点图;想看整体轮廓,可以用直方图;想和另一个班快速比较中间位置及离散程度,可以用箱线图。不存在一张图包办所有问题。
图表名称不要靠外形猜。条形图和直方图都有柱子,但条形图的横轴是类别,直方图的横轴是相连的数值区间。散点图和点图都有点,但散点图的一个点带有两个坐标,点图的一个点只表示一个数值。

24 位同学回答“放学后主要在哪里自主学习”,整理后得到下面的表。
频数回答“有多少个”,相对频数回答“占全部的多大比例”。图书馆有 9 人,所以它的相对频数是:
最后一列因为四舍五入可能出现 或 ,不必误以为原始计数出了错。先回到频数核对总人数,再看舍入位数即可。
如果各组总人数相同,频数和相对频数讲的是同一个排序。可一旦组大小不同,只看人数就会误导。
例如甲班 40 人中有 24 人选择图书馆,乙班 20 人中有 15 人选择图书馆。甲班按人数更多,但按比例比较时:
所以“谁的人数多”和“哪个班更常选择图书馆”是两个问题。前者看频数,后者应看相对频数。
条形图的每根柱子代表一个类别,柱高可以是频数,也可以是相对频数。横轴类别不需要按数值大小排列;为了便于比较,常按频数从高到低排,也可以保留有意义的自然顺序。
一张可以核对的条形图至少要说清楚三件事:横轴是什么类别,纵轴是人数还是比例,数据覆盖的是谁。柱子之间通常留空隙,提醒读者这些是不同类别,不是连续区间。
读条形图时先把最高柱翻译回一句带单位的话。例如这里不是“图书馆最高”,而是“24 位同学中有 9 位把图书馆作为主要学习地点,占 37.5%”。把图形还原成分子、分母和情境,很多误读会自动消失。
现在把“主要学习地点”和“当天是否完成学习计划”放在一起。每个格子记录一种组合出现了多少次,这就是列联表。
先练习最基本的读法。“7”不是图书馆人数,也不是完成计划的总人数,而是同时满足“主要在图书馆学习”和“完成计划”的人数。行合计 是所有在图书馆学习的人,列合计 是所有完成计划的人。
如果问题是“在不同地点学习的人,完成计划的比例是否不同”,分母应固定在每个地点的行合计上。图书馆组的完成比例是:
宿舍组的完成比例是:
这里比较的是“给定学习地点以后,完成计划的比例”。每一行的比例加起来应为 。
但如果问题换成“已经完成计划的 16 人中,有多少人在图书馆学习”,分母就变成完成列的合计:
两个计算都使用格子里的 7,却回答完全不同的问题。列联表最常见的错误并不是除法算错,而是分母拿错。
有人看到图书馆组完成率 ,宿舍组完成率 ,便说“去图书馆会让计划更容易完成”。这个结论走得太快了。
先确认比较对象。我们比较的是不同学习地点组内部的完成比例,所以应该计算行比例,而不是比较完成列里的原始人数。
再看比例差异。图书馆组约为 ,空教室组为 ,家里组为 ,宿舍组为 。样本里确实存在差异。
展示两个类别变量时,可以用并列条形图比较各组合人数,也可以把每个地点的柱子都标准化为 ,再比较完成与未完成所占比例。后者更适合组大小不同的情况,但会隐藏每组到底有 4 人还是 40 人,所以最好同时标出样本量。
24 位同学记录的课后自主学习时长如下,单位是小时:
0.8, 1.0, 1.2, 1.4, 1.6, 1.7, 1.8, 1.9, 2.0, 2.0, 2.1, 2.2, 2.2, 2.3, 2.4, 2.5, 2.6, 2.7, 2.8, 3.0, 3.2, 3.4, 4.6, 7.8
这串数已经排序,所以我们能勉强看出大多数人在 1 到 3 小时之间,最右边的 7.8 小时离主体较远。但数据再多一点,肉眼就会丢失结构。先从最忠实于原始记录的点图和茎叶图开始。
点图在数轴上为每个观察放一个点;相同值就向上堆叠。它不会把相邻值合并,因此很适合几十个以内的数据。
真正画图时,这些位置都落在同一条数轴上。表格这里只是把堆叠数量写出来,方便核对:2.0 和 2.2 各有两个点,其余数值各有一个点。点图的优势是能看见空档、重复值和远点;缺点是样本很大时点会挤成一团。
这组数据保留一位小数,可以把整数部分当“茎”,十分位当“叶”:
茎 | 叶
0 | 8
1 | 0 2 4 6 7 8 9
2 | 0 0 1 2 2 3 4 5 6 7 8
3 | 0 2 4
4 | 6
7 | 8读图键是:2 | 4 表示 2.4 小时,而不是 24 小时。茎叶图既显示分布轮廓,又保留每个原始值;但数据跨越太大、精度太多或样本太大时,它会变得笨重。
茎叶图一定要写“图键”。同样的 2 | 4,在体重数据里可能表示 24 千克,在身高数据里可能表示 2.4 米。没有单位和图键,图形再整齐也无法可靠解读。
直方图不再显示每个准确数值,而是把数轴切成相连区间,再数每个区间有多少观察。用 1 小时作为组距,并规定左端点计入、右端点不计入,这 24 个学习时长可整理为:
记号 表示包含 2.0,但不包含 3.0,所以 3.0 要放进下一组。边界规则必须前后一致,否则同一个观察可能被数两次,也可能没有落进任何一组。
这张频数表画成直方图后,主体集中在 1 到 3 小时,右侧逐渐稀疏,并在 7 到 8 小时处出现一个孤立柱。它给人的第一印象是右偏,但“右偏”要看尾巴,不是看最高柱在左边还是右边。
组距很窄时,柱子很多,随机的小起伏会显得像一个个高峰;组距很宽时,柱子很少,4.6 和 7.8 这样的远值可能与主体合在同一根柱里。起点也会影响边界附近的数据落在哪一组。
下面的交互使用另一组 42 人的屏幕时间记录。数据始终不变,滑块只改变分箱宽度。你可以观察最高频区间、组数和右尾是否稳定。
一个可靠做法是试几个合理组距。如果“主体在较低值,右侧有长尾”在不同组距下都存在,这个结论就比较稳;如果“双峰”只在某一种组距里出现,就先别急着给它编故事。
分箱不是中性的技术细节。故意挑一个能制造高峰、隐藏空档或吞掉异常值的组距,可以让同一组数据支持完全不同的叙述。读图时要找组距与边界;制作图时要展示主要结论对合理分箱是否稳定。
看到点图或直方图后,不要只说“看起来差不多”。一段完整描述至少回答四个问题,而且要带回变量和单位。
先看明显高峰的数量。一个主要高峰叫单峰,两个明显高峰叫双峰,更多则可称多峰。小小的锯齿不一定算新峰,我们找的是稳定、突出的聚集区。
双峰常常提示数据里混着两个群体。例如把早班和晚班的到校时间放在一起,两个作息群体可能各形成一个峰。它不是证明,但会提醒我们回头找分组变量。
再看对称性。左右两侧大致像镜像,可以说近似对称;尾巴向较大值一侧拖得更长,是右偏;尾巴向较小值一侧拖得更长,是左偏。

图里的词不是互斥选项。一组数据完全可以同时“单峰且近似对称”,也可以“双峰且右侧还有较长尾巴”。描述时把峰数和偏斜方向分开说,会比强行选一个标签准确。
这一节先从图上估计主体聚集的位置,不急着计算。24 人的学习时长大多落在 1 到 3 小时,中间位置大约在 2.2 小时附近。这个“中心”只是图形层面的定位,下一节会把平均数、中位数和众数分别算清楚。
离散程度描述数据彼此差得多不多。两组数据都以 2.2 小时为中心,一组全部挤在 2.0 到 2.4 小时,另一组从 0.5 延伸到 5 小时,它们的中心相近,但稳定性和个体差异完全不同。
读图时可以先说主体覆盖的范围,再说全体范围。例如这组学习时长的主体约在 1 到 3.4 小时,总体从 0.8 到 7.8 小时。这样既不会让远点吞掉主体,也不会假装远点不存在。
7.8 小时离主体很远,可以把它标成待核查的异常值候选。这里故意加上“候选”,因为异常值首先是一种相对位置:它和大多数观察不一样;它是否错误,要靠情境和记录过程判断。
可能的情况至少有四种:小数点录错,单位混了,计时没有停止,或者这位同学确实在考试前学习了很久。前面三种需要修正记录,最后一种反而可能是数据里最有解释价值的个案。
当我们想快速比较多组数值分布时,点图往往太拥挤,箱线图更紧凑。它主要用最小值、第一四分位数、中位数、第三四分位数和最大值附近的信息概括数据,并把某些远值单独画出来。
对这 24 个学习时长,按常见的“上下半组分别取中位数”方法:
箱体从 画到 ,中间的线标出中位数。箱体长度叫四分位距:
按常见的 规则,上下界限为:
因此 4.6 和 7.8 会单独标成潜在异常值,须线向下到 0.8、向上到 3.4,也就是界限内最远的实际观察。须线不是自动伸到全体最小值和最大值,这一点很容易被画错。
不同软件对四分位数的细节算法可能略有差异,小样本时尤其明显。比较箱线图前,要确认它们使用同一种算法。 只是筛查规则,不是“超过就删”的判决书。
箱线图擅长比较中心、离散与远点,却看不出清楚的峰数。两个分布可能拥有相同的四分位数,一个是单峰,另一个是双峰。所以箱线图最好和点图或直方图搭配,而不是替代它们。
如果记录有时间顺序,横轴就不再只是普通数值。每日访问量、每周训练里程、每月销售额都可能受趋势、周期和前一天状态影响。时间序列折线图把相邻时间点连接起来,是为了强调先后变化。

读这类图时可以按下面的顺序:
图中的第 12 天是一个明显尖峰,但它不一定是错误。可能当天举办了活动,也可能埋点重复计数。先查日志和活动记录,再决定如何处理。异常值的判断始终依赖情境。
“图书馆、宿舍、家里、空教室”之间没有连续顺序,把四个类别的频数连线,会凭空制造上升和下降。类别比较应使用条形图。
反过来,时间点即使间隔不均匀,也要让横轴距离反映真实时间。把 1 月、2 月、8 月画成等间隔,会把半年空白压成一个普通月度变化。
折线图中的突然变化要同时检查纵轴尺度和时间范围。只截取一小段时间,日常噪声可能看成趋势;把十年数据压得太紧,短期突变又会消失。先问图覆盖多久、多久记录一次。
现在把每位同学的学习时长放在横轴,次日小测分数放在纵轴。每个点代表同一位同学的一对记录。只把两列数字分别画成两个直方图,看不出谁和谁配对;散点图保留了这种配对关系。
读散点图可以记住四个词:方向、形态、强弱、异常。
点云整体向右上延伸,叫正方向:学习时间较长的同学往往分数也较高。点云向右下延伸,叫负方向。没有稳定上升或下降,则说没有明显方向。
“正方向”和“正相关”描述的是一起变化,不等于“横轴导致纵轴”。即使学习时长与分数同向,也可能同时受到基础水平、学习方法、睡眠和题目难度影响。
点云可能接近直线,也可能弯曲、分段或形成两个团块。弯曲关系仍然是真关系,只是不适合用一条直线概括。两个团块可能意味着混入了不同年级、不同课程或不同测验版本。
点越贴近一条窄带,关系越强;点越分散,关系越弱。强弱必须和形态一起说。一个非常清晰的弧线关系,如果只问“是否贴近直线”,反而会被错判为弱。
异常点可以在竖直方向离主体很远,也可以在横轴上远离其他点。横向很远的点有更大的机会拉动趋势线,但“远”不自动等于“影响大”:如果它刚好顺着主体趋势延伸,趋势线可能几乎不变;如果主体本来没有明显方向,而一个远点单独撑出斜率,它就可能控制整张图的结论。

看到散点图中的远点,不要立刻删。先比较“保留它”和“暂时遮住它”时,方向与强弱是否明显改变;再查记录是否真实。删除真实的特殊个案,常常会得到一条好看但只适用于普通情况的结论。
异常值最容易触发两种极端反应:要么把它当错误马上删除,要么为了“尊重数据”一律保留。两种做法都省略了调查。
假设一组调查题完成时间大多在 18 到 24 分钟,有一条记录是 54 分钟。下面的交互允许你移动这个特殊点,观察平均数和中位数怎样变化。
图上离得远,只完成了“发现”这一步。完整处理还需要下面四步。
先核对定义和单位。确认每条记录都使用相同单位、同一时间范围和同一测量方法。54 分钟与 0.9 小时其实是同一数量级,若单位列丢失,视觉上会像巨大异常。
再追查原始记录。检查小数点、重复行、设备故障、计时未停止和缺失值编码。把“未填写”编码成 999,是常见的人造远点。
接着判断情境是否允许。考试前学习 7.8 小时虽然少见,却可能真实;“一次课间学习 78 小时”则明显不合情境。判断依据是研究过程,不是图形审美。
最后做敏感性比较。分别报告保留与排除该点时,中心、离散或散点趋势是否改变。如果确认是错误,应修正并留下理由;如果是真实特殊值,应保留,必要时单独说明它对结论的影响。
这里还要分清“异常”和“有影响”。在一元数据里,极端值可能明显拉动平均数,却几乎不动中位数。在散点图里,一个点可能离主体很远,却恰好靠近整体趋势;另一个点未必最远,却可能把趋势线的方向扭过来。真正需要警惕的是结论对少数点是否过度敏感。
图表比表格直观,也正因为直观,它更容易绕过我们的怀疑。看到一张“差异巨大”的图,先做下面的检查。
条形图用柱长表示数量,纵轴若从 98 而不是 0 开始,100 和 102 会看成相差一倍。条形图通常应从 0 起;若确实需要截轴,必须清楚标记,并同时写出实际数值。
折线图不一定必须从 0 起,因为它常用于观察小幅变化。但读者仍要看刻度:从 98 到 102 是 4 个单位的变化,不是视觉高度所暗示的“翻倍”。
如果数量翻倍,把一个人物图标的高和宽都放大两倍,面积会变成四倍;若是立体图标,体积看起来甚至会变成八倍。数值只控制一个维度时,就不要让两个或三个维度一起长大。普通条形图通常更诚实。
直方图的组距、起点和边界能隐藏空档,也能制造多峰。只给一张直方图却不说明分箱,相当于把关键决定藏了起来。试几个合理分箱,看结论是否稳定。
把销售额放左轴、广告费放右轴,两条线的高度可以通过改变两个刻度范围任意对齐,制造“几乎同步”的感觉。遇到双轴图,分别读取两边单位和范围;更稳妥的展示是拆成上下两个共享时间轴的图。
只截取连续上涨的三个月,可以藏住前一年的下跌;从一个异常低点开始,又会让恢复看成爆发增长。读图时找起止日期,并问换一个合理起点后结论是否还成立。
“完成率提高 50%”可能只是从 2% 提高到 3%,也可能是从 40% 提高到 60%。两者相对增幅相同,实际意义完全不同。比例旁边应尽量保留原始人数和基准值。
快速验图可以问:轴从哪里开始?单位是什么?样本有多大?时间覆盖多久?柱子面积是否多维放大?直方图怎样分箱?有没有双轴?把这几问走一遍,图表对直觉的操控会弱很多。
某学习小组收集了 12 位同学的课后学习时长:
0.9, 1.2, 1.4, 1.6, 1.8, 2.0, 2.1, 2.2, 2.4, 2.7, 3.0, 6.8
请描述分布,并说明下一步选择中心指标时要考虑什么。
先确认变量。学习时长是带单位的数值变量,样本只有 12 个,点图或茎叶图能保留每个值;直方图也能看整体,但少量数据对分箱很敏感。
再描述形状。前 11 个值在 0.9 到 3.0 小时之间形成连续主体,没有看到明确分组;6.8 小时把右侧尾巴明显拉长,所以分布呈右偏。样本只有 12 个,不宜根据这几个点进一步断言峰数。
接着定位中心与离散。主体中心大约在 2 小时附近,大多数记录落在 1.2 到 2.7 小时;全距却延伸到 6.8 小时,说明远点扩大了总体跨度。
然后核查 6.8 小时。先确认单位、计时和当天情境。若它是真实的考前学习记录,就保留并说明;若原始表明应为 0.68 小时,则按证据修正。
甲校 800 名学生中有 320 人骑车上学,乙校 200 名学生中有 100 人骑车上学。哪所学校骑车人数更多?哪所学校骑车比例更高?
某表显示,使用纸质笔记的 30 人中有 21 人通过测验,使用电子笔记的 20 人中有 16 人通过。若要比较两种笔记方式的通过率,应计算哪两个比例?能直接说笔记方式造成通过率不同吗?
“最喜欢的运动项目”和“每天运动分钟数”分别应该优先用什么图?
一张以分钟为单位的茎叶图写着:
1 | 2 5 8
2 | 0 0 4
3 | 1若图键为 2 | 4 = 24 分钟,原始数据是什么?
同一组等待时间用 1 分钟组距时看出两个峰,用 5 分钟组距时只剩一个峰。可以直接宣布它是双峰分布吗?
某次排队时间多数在 3 到 8 分钟,少量记录在 12 到 18 分钟,最长为 31 分钟。请用形状、中心、离散和异常值组织一句完整描述。
若 、,请计算四分位距和上界。数据中最大值为 35,而不超过上界的最大观察为 29,上须应画到哪里?
要看某城市过去 30 天的每日气温变化,用什么图?要看 100 个城市的年平均气温与年用电量关系,用什么图?
散点图里有一个点在横轴上远离主体,却正好落在主体趋势的延长线上。它一定会大幅改变趋势线吗?
一张双轴折线图把广告费和销售额画得几乎完全重合。你至少要检查什么,才能判断这种“同步”是否真实?
类别变量先数频数,再根据问题决定是否换成相对频数;两个类别变量用列联表时,最重要的是找对条件和分母。一个数值变量可以用点图或茎叶图保留细节,用直方图看整体形状,用箱线图快速比较中心、离散与远点。遇到时间顺序看折线图,遇到两个配对数值看散点图。
无论哪种图,都不要只报“高”“低”或“有关”。先把变量、单位和样本说清楚,再描述形状、中心、离散与异常值。最后检查坐标轴、分箱、面积、双轴、时间窗口和分母,确认图形没有把差异夸大或藏起来。
图像会告诉我们下一步该算什么:右偏且有远点时,平均数会不会被拉走?两组中心相近时,哪一组更分散?箱体和须分别对应什么数量?下一节就把这些视觉判断变成平均数、中位数、四分位数、极差和标准差,让“看起来”落到可以比较的数值上。
接着检查样本量。每组只有 4 到 9 人,一个人就能让比例改变十几个百分点。这个表适合提示线索,不足以给出稳定结论。
最后回到上一节的研究设计。地点是同学自己选择的,学习习惯、当天任务量和自律程度都可能同时影响地点与完成情况。因此可以说“在这 24 人的记录中,两者有关联迹象”,不能直接说地点造成了差异。
| 1 |
| 0 |
| 0 |
| 1 |
最后才决定数字摘要。分布右偏且有远点,平均数可能被拉高;如果问题是“典型同学学习多久”,中位数通常更稳。如果问题涉及全组总学习时间的均摊,平均数仍然有用。下一节会精确比较这些选择。