
南桥市在教学模拟的二〇二一年正式启动了“青年技能跃迁计划”,希望通过职业培训提升本地青年的就业能力。林澈受邀跟踪这一项目的进展,观察了一批接受模拟培训的青年:有人培训时间较久,有人时间较短,培训后的月收入和稳定就业情况也各自不同。这些教学模拟数据的分布,就像一组散落在图表上的点,而不是轻易就能总结成规律的答案。
面对这些变化多样的观测值,林澈要做的不是寻找唯一的标准答案,而是分析这些收入和培训时长之间可能存在的联系。她发现,每位青年的经历都不同,有的人培训后收获显著,有的人则变化不大。这让她意识到,理解这些散点的分布和趋势,而不是仅仅关注个别人的成功与否,对评估培训政策更加重要。
需要提醒的是,本章中涉及的城市、人物、政策、样本、金额、比例和所有计算结果,均为教学模拟设定,只为训练分析思路。我们在这里练习的,是如何用有节制、有条件的方式描述数据之间的预测关系,并反思这些关系能够承担哪些解释,哪些则不能直接归因于政策本身。一条回归线描绘的是样本中的趋势,而不是政策造成结果的铁证。
林澈先把培训时长放在横轴,把结业月收入放在纵轴。她看到的不是一串会自动排队的点:相同培训时长的青年仍可能进入不同产业、拥有不同基础能力,也可能因为岗位机会不同而拿到不同收入。
她需要的不是穿过最多点的线,而是一条能给每位青年一个共同基准的趋势线。先把这条线理解成“在相近培训时长下的平均预测”,再写下模型,符号就不会像一道突然出现的门槛:
这里 是模型给出的模拟收入预测, 是观察值减预测值后的残差。残差为正,表示这位青年高于线上的预测;残差为负,表示低于预测。它是样本估计后的可见差,不是总体中不可见的误差项本身。
如果林澈改看稳定就业,结果变量会是零或一。线性拟合仍可先描述预测概率的平均差异,却可能给出零以下或一以上的预测。这个提醒不会否定最小二乘,而是要求她在解释前先确认:自己正在讨论金额,还是概率。

图上的竖线值得慢慢看。普通回归把培训时长当作给定条件,因此比较同一横坐标上的纵向偏差;它不是点到直线的几何最短距离。若培训时长也严重测错,或研究目标是几何轨迹,就不能不加思考地沿用这套比较。
对林澈来说,拟合线不是给每位青年贴上“应该挣多少”的标签。它只是把同一培训时长附近的模拟收入压缩成一个平均位置,方便她看出哪些观察偏高、偏低,以及这种偏离是否集中在同一行业、机构或随访时段。
林澈不会因为一个残差很大就删除它。她会先回看收入单位、访谈时间和培训机构,再问这个点是不是揭示了行业差异或样本边缘。残差首先是提醒你回到资料的信号,而不是要求把不顺眼的观察清走。
截距也需要放回样本范围解释。若零培训时长根本不在模拟样本中,截距只是直线在坐标轴上的计算位置,不宜被说成“完全未培训青年必然获得的收入”。斜率同样只描述当前数据支持范围内的平均预测变化。
林澈会把一条拟合线和若干典型残差一起呈现。读者因此能同时看见共同趋势与未被解释的差异,而不会把模型的平滑外观误认为每个人的经历都被准确复述。下一步,她需要决定这些偏差究竟该怎样汇总。
若把残差直接相加,收入高于预测的人可以抵消收入低于预测的人,明显不合适的线也可能得到接近零的总和。林澈因此需要一个不会让正负偏差互相掩盖、又能比较所有观察的共同准则。
她选择平方,不是因为平方更“正确”,而是因为它让每个偏差以非负方式进入总损失,并使较大的偏差有更重的分量。这个判断先成立,公式才有意义:
最小二乘所说的“最小”,只是在当前样本、当前变量和当前函数形式中,让 尽可能小。它不承诺每个人都预测准确,也不证明培训造成收入变化;它只是把“哪条线更贴近这些散点”变成可重复的比较规则。
林澈可以把两条候选线想成两种资源配置建议。一条线让多数青年只偏一点,却在少数人身上偏得很远;另一条线让偏差比较平均。平方和会更重视前一种大偏差,这不是价值判断,而是她预先选定的拟合规则。
这个规则也解释了为何软件输出一个系数并不结束分析。系数来自所有观察的共同权衡,任何录入错误、极端收入或样本边缘的培训时长都可能改变权衡。先看这些来源,再讨论是否要报告替代规格,才是合理顺序。
下面的模拟残差说明了为什么不能只看残差和。第二组的直接相加为零,却同时在绝对偏差和平方偏差上更小。平方让林澈既看见抵消问题,也看见一个偏得很远的观察会怎样拉动拟合。

平方也带来代价:异常但真实的高收入或低收入观察会更有影响。林澈若发现少数点主导结果,应报告核查和敏感性分析;她不能仅靠更换损失函数来修复遗漏变量、选择进入项目或错误的因果叙述。
如果一个模拟青年因为一次性奖金而远离趋势线,林澈会先确认研究问题是否要包含这笔收入。若要包含,它是收入分布的一部分;若定义本来排除奖金,则应按事先写好的变量规则修正,而不是在看见回归结果后临时改口。
收入从元换成千元时,每个残差会按比例缩小,平方和会按比例的平方缩小。数值变了,拟合关系不一定变了。因此她只在相同结果定义、相同样本和相同单位下比较平方和,并把单位写进结果表。
这样一来,最小二乘的重点变得清楚:它优化的是样本内的距离,不是政策是否公平、是否值得投资,或是否在未来仍有效。那些问题会在模型解释、外部预测和研究设计中继续出现,不能被一个更小的平方和替代。
当林澈同时加入学历、入学前收入和地区,直线不再只围绕一个横轴转动。她把这些变量排成设计矩阵 ,把收入排成向量 ;最小二乘在所有能写成 的预测中,寻找离 最近的一个。
这种“在允许的方向里找最近点”的直觉在前,正规方程随后出现。它不是要你手算矩阵,而是把最低点的条件浓缩为一条可以检查的关系:
正规方程也可写成 。带截距时,残差之和为零,残差也不再沿任何已纳入解释变量呈现线性方向。若 可逆,可写出 ;实际软件会用稳定的计算方法完成同一件事。
这条条件给林澈一个实用检验:拟合完成后,培训时长与残差之间不应还留有模型可以继续利用的线性方向。可这只是对已经放入 的列成立;模型外的能力、家庭支持或行业景气仍可能同时影响培训选择和收入。
把矩阵看成一张比较说明书会更容易读。常数列给出共同基准,培训时长提供主要方向,学历和地区提供调整方向。每增加一列,林澈都在声明“我愿意让这个因素参与定义谁与谁可比”。

是 在 列空间上的正交投影, 是垂直留下的部分。给模型加入变量后,列空间只会扩张或保持不变,训练样本残差平方和不会上升;这解释了为什么不断加变量总能改善或维持样本内拟合。
这也说明为什么单看训练误差容易让人过度自信。加入一项没有机制支持的变量,样本内仍可能显得更贴合,却未必能预测下一批青年,更可能把偶然波动记进模型。林澈因此把拟合改善和研究问题是否更清楚分开判断。
但“最近”只对已选空间成立。遗漏的能力、项目筛选和错误的控制变量都不会被投影自动消除。多元模型的拟合超平面通过解释变量样本均值组合对应的结果均值:各解释变量同时取样本均值时,拟合值等于 ,但这仍只是样本代数性质。
这个均值性质帮助她校对表格,却不能成为无偏的证据。即使线在均值处对齐,长培训青年也可能在看不见的资源、动机或岗位渠道上与短培训青年不同。代数上的平衡和研究设计上的可比,是两件不同的事。
若一列变量能被其他列精确拼出,系数就没有唯一解;若它们只是高度相似,系数仍可能很不稳定。林澈因此把“有没有足够独立的比较信息”放在“软件是否给出了一个数字”之前,并避免把共线性问题误当成理论冲突。
例如,若同时放入完整的地区类别与截距,或把培训总时长和所有互斥阶段时长完整并列,模型就缺少区分各自贡献的空间。选择基准组、合并重复指标或改写问题,往往比保留每一列更能让结果可读。
拟合完成后,林澈把残差画回培训时长、预测值和机构标签上。她不期待所有点贴在线上,而是期待没有清晰的弧线、漏斗或按机构成团的图案;这些图案意味着模型剩下的部分可能仍有可解释的结构。
她特别留意培训很短和很长的两端。若两端只各有少数模拟青年,平滑的趋势线可能主要依赖中间区域;这时对极端时长的预测是在延长线上的推测,而不是数据直接支持的比较。
她的检查顺序保持很短:
弧线常提示线性形式太硬,漏斗形常提示不同区域的误差散布不同,机构内相似则提示误差可能相关。它们影响的层次并不相同:有时应改变函数形式,有时应调整标准误,有时最重要的结论是不要把样本边缘的预测外推得太远。
南桥市的模拟机构如果采用不同讲师和岗位推荐渠道,同一机构青年共享的结果差异就不能被当成完全独立的信息。林澈会把机构标记保留下来,分别思考它是需要控制的环境差异,还是标准误需要尊重的聚类层级。
最关键的要求不能由残差图证明:给定 后,遗漏部分的平均值不能再随培训时长系统变化。更有资源的青年可能既选择更长培训又更容易就业,这会让简单斜率混入选择差异,哪怕残差图看上去很安静。
她不会用“图形没有明显问题”替代这一判断。项目名额怎样分配、报名者如何筛选、哪些基线条件被记录、谁在后续随访中消失,才是她说明条件均值为何可能接近零或为何仍应保留疑问的材料。
异方差稳健标准误能让不确定性的计算更可靠,却不能修复遗漏能力、反向因果或选择性失访。若同一机构的青年共享讲师和岗位渠道,林澈还要让标准误尊重这种聚集;方法的重点是对应裂缝,而不是给模型贴上“稳健”的标签。
若她发现收入残差随预测收入明显张开,首先会如实报告不均匀的散布,再使用与问题匹配的推断处理。若发现关系本身弯曲,则需要重新思考函数形式;把所有异常都交给一种标准误处理,只会掩盖不同问题的区别。
林澈希望比较培训时长相近以外的差异,于是加入学历、入学前收入和地区。完整模型可写成 ,其中 是培训变量, 包含常数列和其他控制变量;“控制后”指的是在这些变量的线性信息被扣除后再比较。
部分回归把这件事拆开看。先用包含截距在内的其他解释变量解释培训时长,留下培训残差;再用同一组变量解释收入,留下收入残差;把收入残差对培训残差做一元最小二乘,得到的斜率与完整多元回归中的培训系数相同。
这一步最适合消除“控制变量像黑箱”的感觉。它没有让青年消失,也没有为每个人制造一个克隆体;它只是从培训时长和收入中分别拿走控制变量已经解释的线性部分,再比较两边仍然留下的共同变化。
这两条路径不是两种结论,而是同一个比较的两种视角。表格把它们并排,是为了让你看见截距不能在残差化时消失,也看见“把控制变量放进模型”并不是把青年从样本中删掉。

控制变量的时间顺序比数量重要。事前学历和基线收入可能帮助比较,结业后的岗位等级却可能正是培训影响收入的路径;把后者当普通控制,会把问题改成“绕开岗位升级后的培训关联”。林澈先决定想估计什么,再决定控制什么。
如果她想描述培训与收入的总条件关联,培训之后的岗位变化未必该被扣除;如果她想研究在同样岗位等级下的收入差异,岗位等级又会成为定义问题的一部分。控制变量没有万能清单,只有与研究问题相匹配的角色。
她也会检查共同支持。若高学历青年几乎都进入长培训、低学历青年几乎都在短培训,模型只能依赖外推来制造“其他条件相同”。偏相关同样有边界:两变量都对包含截距的同一组控制变量残差化后,它只描述这组条件下的线性紧密程度,并不替代收入单位下的系数解释。
当加入学历后培训系数改变,林澈不会急着判断哪一个模型“才是真的”。变化可能说明原先混入了学历关联,也可能反映分析样本因缺失值而改变。她会在共同样本上复算,并把系数变化解释为比较对象发生了怎样的改变。
控制变量若本身测量粗糙,调整也只能做到粗糙的程度。问卷上的“有无工作经验”不等于完整的技能、行业网络和工作质量;变量名称看似相近,并不保证它真正挡住了林澈担心的混杂路径。
她最后会把共同支持写成图形或样本描述,而不是只写在方法段落里。读者若看见哪些背景组合同时存在于长短培训组,才知道“控制后”的比较在哪里由数据支撑,哪里主要依赖模型的线性外推。
回归表不是结论生成器。林澈先确认结果变量、培训单位和分析样本,再看培训系数是在什么控制条件下得到、区间有多宽、标准误是否尊重机构或时间结构。这样读表,能避免先被一个星号或一个很高的拟合优度带走。
若模型含截距,总波动可以被看成拟合部分和残差部分的和。先把“相对只预测均值,模型减少了多少样本误差”的直觉抓住,再写下这个分解:
其中 为总离差平方和, 为回归平方和, 为残差平方和。 只说当前样本中模型解释了多少波动,不是培训的因果强度,也不能保证新一批青年上的预测会同样准确。
林澈不会把低 直接当作项目无关紧要。收入包含许多个体层面的随机差异,一个具有现实意义的平均关联也可能只解释很小一部分总体波动。反过来,高 也可能来自结果的机械成分或重复信息,并不自动支持政策叙述。

加入变量会让训练 不增,所以单看 总会偏爱更复杂的模型。林澈还看变量是否发生在培训之后、样本有没有变化,以及新模型能否在未参与拟合的模拟观察上维持表现;拟合、预测和因果是不同任务。
若目标是预测,林澈会把一部分模拟观察留作检验,看看未见数据上的误差是否仍可接受。若目标是因果解释,她更关心项目分配和混杂控制是否可信;一个很会预测的模型也可能完全不能回答培训的反事实影响。
标准误描述在相同抽样规则下系数会怎样波动,它不涵盖遗漏混杂、错误编码或选择性失访。区间比单个显著性符号更能呈现不确定性:它既可能包含很小的差异,也可能包含对资源配置有意义的差异。
这就是为什么林澈同时报告量级与区间。若培训系数为正但区间很宽,最诚实的说法是方向在样本中为正而精度有限;若区间很窄却量级很小,也应讨论这个差异是否足以抵消培训成本,而不是只报告统计显著。

当培训变化很少、控制变量高度相似或样本只覆盖少数机构时,系数可能不精确,即使表格排得很整齐。林澈会另外写明外推边界:模拟报名者中的关系不能自动推广到所有青年、其他地区或未来不同的劳动力市场。
她也会把结果放回单位中读。培训从月改成周,或收入从元改成千元,系数的数字会重标,但模型比较的关系未必改变。把连续变量中心化时,截距会对应平均培训条件,通常比零点更容易解释。
现在回到林澈的模拟研究。她先用培训时长预测月收入,再加入基线收入、学历和地区;同时把稳定就业作为补充结果。练习的目标不是凑出一个“正确系数”,而是让每一步的比较对象和解释边界都能说清。
你可以按下面的操作顺序写一份很短的分析备忘录:
这份备忘录最重要的不是格式,而是时间顺序。林澈先写变量定义与分析范围,再看模型结果;如果等看到系数才决定哪些青年算样本、哪些变量算控制,分析很容易在无意中朝着最想要的结论靠拢。

林澈还会做一次单位检查。培训从月改成周、收入从元改成千元时,系数数值会重新标尺,拟合关系却不必改变;把培训时长中心化后,截距会落在平均培训条件,更容易被读者理解。
她也会把稳定就业单独说明。零或一结果上的线性模型可以给出容易阅读的平均预测差异,却可能出现范围外预测和不均匀误差。它适合作为基准描述,但若问题要求概率解释,就应补充更匹配的二元结果模型。
最后,把结论写得与证据一样具体:在模拟样本和列出的事前条件下,培训时长与月收入呈现某方向的条件预测差异;若参与并非随机,或共同支持与失访仍有疑问,就不能单靠这条线断言项目已经造成收入变化。
如果读者问“那么培训有没有用”,林澈不会只指向一个系数。她会回到问题的层次:样本中是否有正向条件关联、模型在谁身上预测得较好、项目分配能否支持因果比较,以及这些结论是否能移到别的机构和年份。
| 更贴近:直接相加虽为零,整体偏离却更小 |
| 一条线只在少数点偏得很远 | 可能接近零 | 需与另一条线并列 | 会被明显放大 | 提醒核查异常点、函数形式或群体差异,而不是立即删点 |
| 两条线使用不同收入单位或不同样本 | 不宜直接比较 | 不宜直接比较 | 不宜直接比较 | 必须先统一结果定义、单位和分析样本 |
| 新模型加入额外变量 | 可能改变 | 不受最小二乘准则保证,可能增也可能减 | 训练平方和只会下降或持平 | 拟合改善仍需结合变量角色与留出表现判断 |
| 观察的培训时长位于样本边缘 | 单个残差未必很大 | 需结合位置判断 | 可能强烈影响拟合 | 区分“结果异常”与“自变量杠杆高”两种风险 |