南桥市在 2021 年启动“青年技能跃迁计划”。研究员林澈面对的是一份教学模拟数据:有人读完较长课程后很快稳定就业,有人读了同样周数却仍在找工作。她需要的不是一句响亮结论,而是一种能把问题、比较与边界说清楚的语言。
本章中所有青年、记录、系数和结果均为教学模拟。线性回归帮助我们描述条件平均的关系;它不会自动告诉我们谁的生活将怎样,也不会单凭一张表证明计划已经改变了现实。
林澈先不打开软件。她把会议里那句“培训有用吗”改成:在这份教学模拟中,培训结束后三个月,完成不同培训周数的青年,其月收入平均处在什么位置?这句话已经确定了人群、时间窗、结果和主要比较。
她又为稳定就业写一条并行问题:在相同窗口内,给定若干培训前背景时,培训周数与稳定就业的条件概率怎样共同变化?收入与稳定就业不能互相替代;前者是金额,后者是状态,二者可能朝不同方向变化。
在第一次读表时,林澈发现“收入高”可能来自更长工时,“稳定就业”却可能没有同步提高。她因此拒绝用一个总分替代两个结果,并要求每个结果都先有清楚定义,再进入同一段政策讨论。
林澈提醒同事,问题中的动词决定证据门槛。“共同变化”允许描述关联;“预测”要求检查新样本表现;“改善”则需要可信对照。先决定要说哪一种话,才知道该收什么数据、建什么模型、保留什么限制。

数据表里的每一列都有时间位置。林澈把月收入和稳定就业放在结果一侧,把实际培训周数放在主要解释一侧,再把培训前的学历、既往经历、通勤条件放进背景一侧。企业推荐和实习机会虽然重要,却常发生在培训之后。
这种排列不是形式主义。若把培训后的企业推荐当作普通背景固定,模型可能会抹去培训经由推荐影响就业的一部分关系;若把没有填写收入的记录当作零,也会把“未知”误当成“没有收入”。变量含义必须先于计算。
她还要求每个变量带上单位和来源。周数究竟是报名、到课还是完成?收入是税前还是税后?通勤是分钟还是公里?编码、时间与测量来源一旦不清,回归输出再整齐,也不会变成可解释的证据。
林澈最常追问的是缺失:未填收入、未联系上、确实没有收入,必须是三个不同状态。若失访集中在长通勤或短培训的青年,留下来的样本本身就会改变比较对象,模型不能替这一步诊断。
散点图里,培训 8 周的青年不会排成一个点:有人因为已有经验进入技术岗位,有人因照护责任只能接受短工时。林澈不让直线抹掉这些差别,而是先让读者看见,同一周数附近的人依然有很宽的收入分散。
回归所关心的,是给定培训周数时收入的平均中心。用符号写为 。它可以读作:若反复观察培训周数为 的相似教学模拟青年,收入的中心大致在哪里,而不是其中每个人必然拿到多少。
这个区分很重要。条件平均高于另一个条件平均,不等于每一位青年都更高;样本中的平均关系向上,也不等于让同一位青年多读一周就会沿着这条线移动。平均、个体和因果,必须始终分层讨论。
林澈会先看每个周数段有多少人。若 12 至 14 周只有少量模拟记录,右端的均值就更容易受个别经历影响。直线可以借用邻近信息,却不能把数据稀疏处伪装成观察充分处。
她还会按课程方向和既往经历重画散点。若总体上升只来自一个课程类别,或某个背景群体从未出现在长培训区间,所谓“整体平均”就需要拆开讲。看见分化,是决定下一步建模的前提。

当散点中心大致随培训周数上移时,林澈暂时使用直线近似。它把复杂的点云压缩成起点和坡度,方便沟通,也方便检查;它并没有宣布真实关系永远笔直。若图上出现平台、阈值或弯曲,直线就应该让位或缩小解释范围。
假设教学模拟拟合得到 。这是根据样本得到的条件平均线,不是每个人的收入方程。最小二乘选择使实际值与拟合值的偏差平方和较小的候选线,因此大偏差会受到更重的权重。
林澈不会把“最小”误读为“正确”。一处多写了零的收入记录,或少数培训周数极高的个案,都可能改变线的位置。拟合前后的核对,目的是区分真实罕见经历与记录错误,而不是删除不合预期的青年。
在南桥的模拟讨论里,她让同事先手画三条候选线:一条偏高、一条偏低、一条穿过点云中部。这样大家先看见偏差如何累积,再理解为什么最小二乘偏好整体贴近而非讨好某一个醒目的个案。
她把建模过程写成能被复走的动作,而非一连串软件按钮:
在 中,斜率 145 的单位是元/周。把 代入,拟合收入为 元;比较 4 周与 8 周,线上的拟合平均差是 元。
正确的说法是:在这份教学模拟和这条线性近似中,培训周数多 1 周与拟合月收入高 145 元相关。它不是“每个青年都会多拿 145 元”,也不是“培训已造成 145 元增长”。单位、对象与语气都是系数的一部分。
截距 3,180 是 时延长线的拟合起点。若样本中没有 0 周培训的青年,它只是数学交点,不能轻率地写成未培训者的真实收入。林澈总会先看零点是否位于数据和政策语境内。
若把周数改成天数,或把收入改成千元,系数的数字会改变。真正可比较的是有意义的情境差,例如四周培训、三十分钟通勤,或完成与未完成之间的差;不是脱离单位地比较谁的系数看上去更大。
林澈也不把正斜率理解为每一个区间都上升相同。若前四周提升快、之后趋平,一条正直线仍可能概括总体方向,却会错过局部变化。她会先把斜率称为样本支持范围内的平均坡度。

实际收入减去拟合收入,得到残差 。对林澈而言,它是线没有捕捉到的那部分信息:课程质量、岗位机会、家庭责任、测量误差或其他未观察因素,都可能留下正负残差。
她先看残差是否围绕零线随机散开。以拟合收入为横轴时,若低拟合值端多为负、高拟合值端多为正,或残差先负后正再负,直线可能漏掉了形状;若培训周数越大散布越宽,误差波动可能改变。诊断让结论获得边界,而非让模型失去价值。
某个点离线很远,也不能自动删除。它可能是录入错误,也可能是真实但罕见的路径。另一些点残差不大,却因培训周数远离多数人而强烈牵动斜率;林澈会分别检查“异常”和“高影响”,并说明处理前后的差异。
当某一课程方向的残差总偏正、另一方向总偏负时,她会回到现场追问课程类别是否遗漏。残差无法自己说出原因,却能把研究者带回数据生成过程,而不是让“未解释部分”成为一句空话。
同一班青年也可能共享教师、推荐渠道和就业市场,这会让残差彼此相关。正式研究若记录班级和地区,后续才能判断不确定性是否被低估。即使课堂尚未计算区间,也要为这种结构保留数据线索。
培训时长从来不是在同一条起跑线上发生的。已有连续工作经历的青年可能更容易坚持课程,也更容易获得职位;学历、居住地和通勤也可能同时与培训选择和收入相关。简单线把这些共同变化都混进培训周数的斜率。
林澈于是写下多元模型 。其中 的人话是:在模型列出的经历、学历和通勤相同的条件下,培训周数多 1 周对应的拟合平均收入差。
“其他条件相同”不是让现实中的同一人冻结不动,而是模型内的比较语言。它只能固定已测量且正确进入模型的变量;如果没有记录求职主动性、行业网络或当地岗位变化,系数仍可能承接它们的关联。
更麻烦的是,背景变量之间可能太相似。若培训周数、到课天数与完成比例几乎记录同一件事,数据就难以区分各自的关联。林澈宁愿保留一个与问题最贴近的指标,也不愿让一组不稳定系数制造虚假的精确感。
她也不会因为一个变量能提高样本内拟合就加入它。变量的时间位置和研究角色比数字更先。对培训总关联感兴趣时,培训后的推荐、实习和岗位等级都应先被视为可能的路径,而非自动的控制项。

在教学模拟表中,加入既往经历、学历和通勤后,培训周数系数从 145 变为 118。这个变化不是“第一个模型错了、第二个模型真了”,而是比较对象变得更具体:现在比较的是这些已测量背景相同或相近的青年。
林澈会检查两个模型是否使用同一批人。新增变量常带来缺失,若一批青年因此被排除,系数变化可能来自样本改变,而不只是背景调整。她会先在相同完整样本上重跑简单模型,再讨论加入变量带来的差异。
她也会检查共同支持:在相同学历和通勤条件附近,是否真的同时存在培训较短和较长的青年?若长培训组只集中在少数优势背景,模型仍会在缺少实际比较的地方延长关系,条件语言就需要更加克制。
最后,她把结果写成完整句:在这份教学模拟与该模型中,比较既往经历、学历和通勤相同的青年,培训周数每多 1 周与结业后三个月拟合月收入高 118 元相关。句子较长,却保留了单位、条件、时间和性质。
如果两个变量高度重合,“其他条件相同”的句子还会失去实际对象:数据中可能根本找不到只改周数而到课天数不变的青年。林澈会把这种缺少共同支持的情况写入限制,而不是照搬通用解释模板。
月收入是连续数值,拟合值可以用元来读。稳定就业只有 0 和 1;其条件均值恰好是取值为 1 的条件概率。因此 ,可以读作给定这些条件下实现稳定就业的概率。
若教学模拟线性概率模型中的 ,培训周数多 1 周对应稳定就业的拟合概率高 0.018,即 1.8 个百分点。这里必须说“百分点”,因为 0.018 是概率的绝对差,不是相对百分比。
林澈会拿一个情境检验表达:若某青年在 6 周时拟合概率为 0.54,保持模型中的其他变量不变,7 周时为 0.558。模型描述的是两个条件位置的差,不是在保证这位青年会稳定就业。
线性概率模型适合看清条件平均的共同逻辑,但也可能给出小于零或大于一的值。稳定就业成为核心结果时,可比较Logit、Probit等模型;线性概率模型在适当研究目标及稳健推断下也可使用;本章的线性形式是教学近似,不是对所有就业问题的终点。
无论采用哪种模型,稳定就业的定义都必须先固定。若把每周二十小时和三十小时都称为“稳定”,比较就会随口径漂移。林澈会同时报告口径、观察月份和无法判断状态的记录数。
林澈常被问:“模型解释了多少?” 回答的是一个有限问题:相对只用样本平均收入作预测,回归模型在当前样本中减少了多少平方离差。它衡量样本内拟合改进,不是给政策签发因果许可证。
若教学模拟 ,可以说模型相对均值基准捕捉了部分收入变化。不能说 36% 的收入由培训造成,也不能说模型理解了 36% 的人生。就业与收入有大量个体差异,低 不必使一个平均关联失去意义。
反过来,高 也不足以说明直线形状合适。弯曲关系可能拟合得很好却仍让直线残差呈系统图案;新增变量也会让普通 不降。林澈把它和散点、残差、样本外预测、变量角色一起看。
她特别警惕“模型越复杂越好”的错觉。若只是为了提高样本内数字而加入无关列,模型可能学进偶然波动,在下一批青年身上反而更差。拟合好坏必须服务于明确目的,而不是替目的做决定。
林澈把 放在结果表的后面,而不是标题里。读者应先看研究问题、散点和系数是否能解释,再看这个摘要指标。这样更不容易把一个方便比较的比例误当成模型质量或政策价值的总分。

把一名模拟青年的培训周数、经历、学历和通勤代入模型,可以得到拟合收入。它代表同类条件下的平均中心,不是一张工资承诺书。预测新个体还包含其未观测差异,因此个体预测通常比群体平均的预测更不确定。
林澈不会让一个点预测独自出现。她会说明变量的取值、模型使用的样本、适用时间以及误差范围。若模型未来用于服务建议,还要检查不同街区、不同经历青年是否有系统不同的误差,不能只报告一个总体准确率。
外推尤其危险。教学样本若只覆盖 2 至 14 周培训,把 40 周塞进直线只会得到算术延长,不会得到可信预测。课程强度、参与者构成与岗位市场都可能在范围外变化,斜率没有义务继续不变。
预测的用途也需要被说出来。辅助职业顾问理解可能的支持需求,和用分数决定谁获得名额,是不同的制度行为。前者仍需人工复核,后者还涉及公平、申诉与历史机会差异,不能由回归模型替代价值判断。
当新的课程、年份或劳动市场出现时,林澈会重新检查模型。历史数据中的关系可能随岗位需求和参与者构成改变;“曾经可用”不等于“现在适用”。更新与监测是预测使用的一部分,不是发布后的附加工作。

前文的主要解释变量是连续培训周数。若问题是“多一周培训会怎样”,可以把潜在结果写为 ,并关注如 。这和观察到的不同周数青年之间的收入差,是不同层次的对象。
为便于理解,也可把处理明确为二元的“接受定义清楚的培训”与“不接受”,再比较 和 。同一名青年只能走其中一条路径,所以现实研究必须寻找可信的替代比较,而不是假装两种结果都被观察到。
主动性、信息渠道、岗位需求可能同时影响培训和收入;反向选择也可能发生。即使回归纳入了学历和经历,仍可能遗漏这些因素。培训后的推荐若被控制,还可能截断培训经由推荐形成的路径,改变所回答的问题。
随机资格分配、清楚的准实验规则或高质量追踪设计能加强因果证据,但每种设计都要检查执行、失访、外溢、共同支持和适用范围。普通观察性回归很有价值:它可以描述关联、暴露资料缺口并帮助规划下一步,却不应越界宣布改善。
因此,林澈把因果语句留给设计足以支持的分析,把观察性模型的价值放在更诚实的位置:它告诉团队哪些青年和结果值得持续追踪,哪些培训前差异必须补测,哪些对照安排值得在下一轮项目中争取。
林澈请你为 300 名教学模拟青年写一页分析备忘录。第一句要定义月收入与稳定就业的时间窗;第二句说明培训周数的口径;随后展示散点和两个模型。你的目的不是挑选最漂亮的系数,而是让另一位同事能复走你的比较。
她要求结论不超过 120 字,却必须包含四件事:培训系数的单位、比较条件、一个残差或覆盖发现、以及因果边界。若这四件事装不进一句话,通常不是写作技巧不足,而是模型问题、变量角色或结论用途尚未理清。
完成后,把自己放在审稿人的位置:样本在哪些周数上稀疏?背景变量发生在培训前吗?系数是在讲关联、预测还是因果?有没有把拟合值当个人承诺?这些追问会让一条线变得更可靠,也让下一轮数据收集更有方向。
林澈最后把工作留在下一步:补收培训前求职时长、岗位网络和照护压力等信息;记录班级与地区;寻找可形成对照的资格规则或名额安排。真正好的模型不会结束问题,而会把下一项值得收集的证据说清楚。