南桥市在二〇二一年启动“青年技能跃迁计划”。林澈拿到报名、课程和就业记录后,最先看到的是完训青年似乎就业更稳定、收入也更高。她没有立刻把这当成项目成果,因为一个更难的问题随后出现:如果这些青年当初没有完训,他们会怎样?
本章中的南桥市、林澈和项目均为虚构教学案例,不报告现实结论。你将跟着她把一句日常判断拆成研究对象、处理状态、结果和比较逻辑;计量经济学的价值,正是在这个拆解过程中显现。

项目办公室说:“参加者发展得更好。”林澈先把这句话停在纸面上:它可能是描述,也可能被误写成因果。若她只想知道参加者的状况,汇总记录就够;若她要决定项目是否值得扩大,就必须寻找一个能近似“没有培训时会怎样”的比较。
她也区分预测与评估。根据报名时信息预测谁会失联,能帮助工作人员安排回访;但预测得准不说明培训造成了就业变化。你应先确定要解决哪类问题,再决定数据和模型应承担什么任务。
林澈发现,报名者并非随机走进课程:有人已有工作经历,有人通勤更方便,也有人因家庭照料中断学习。这些条件既可能影响完训,也可能影响就业。只比较两组均值,等于把课程影响和原有差异装进同一个数字。
计量经济学把经济学的制度故事、统计学的不确定性和数据记录的限制放到同一条推理链上。它不承诺自动消除偏差,而是要求你说明:变量是否测对了,比较是否公平,结论又能走到哪里。

林澈把问题写成:“在符合资格的南桥青年中,完成培训相对于未完成培训,是否改变后续观察期内的稳定就业与月收入?”这句话让对象、处理、结果、比较和时间范围都可以被追问,也避免了先选一个热门方法、再为它寻找问题。
“完成培训”只是本章的教学处理状态。正式评估要分清项目获邀的意向处理效应、实际接受某一方案的效果,以及在额外假设下的完训效应;中途就业、退出和支持服务都会使这些对象不同,不能混作同一种结论。

完训者收入更高,可能来自课程,也可能来自教育、既往经历、家庭支持和街区岗位机会。这些处理前因素同时影响完训和结果,形成混杂。即使培训发生在收入记录之前,已经预期会就业的青年也可能更愿意坚持完成课程。
林澈还不能把培训后的证书、面试次数或求职信心随意当作控制变量。它们可能正是课程影响就业的路径;控制它们会把“培训总体改变了什么”换成另一个更窄的问题。变量的时间和角色比变量数量更重要。
林澈真正关心的,是同一位青年在“完成培训”和“没有完成培训”两种状态下,稳定就业会不会不同。可现实不会给她两次机会:小周要么完成了培训,要么没有完成,她只能看到其中一条结果。另一条没被看见的可能性,就是反事实。
所以,她不能随手抓一群未完训者来比较。更合理的问题是:如果那些已经完训的青年当初没有完成培训,他们的就业结果会像谁?只有当比较组在培训前的动机、就业经历、照护压力和通勤条件上足够接近时,比较才是在逼近这条看不见的路径。

如果未完训组能够近似代表完训者在“未培训”状态下的结果,那么两组结果的差异可以先被理解为完训者的平均因果影响。但这仍不是一句“培训对所有青年都有效”:它回答的是“对实际完训的人,培训可能带来了什么差别”,而不是自动推广到每一位符合资格的人。
林澈接下来会把这个判断拆成可检查的动作:先看两组在培训前是否已经明显不同,再追问谁更容易完成培训,最后说明哪些差异仍可能没有被记录。你会发现,计量经济学并不是凭一个回归系数宣布因果,而是在不断追问:这个比较,到底像不像同一个人走向两条不同的路?
林澈先检查每行数据代表谁、变量何时发生、空白意味着什么。她发现报名系统、培训记录和就业资料并不会覆盖同样的人;若身份合并错位,或收入只在被联系到的人中出现,后面的模型只会更精确地分析一个有偏样本。
直觉上,她想在教育、既往经历和街区机会相近的青年间比较完训状态。以下模型把这种条件比较写清;收入 (W_i) 是结果,完训 (D_i) 是处理,(X_i) 是培训前特征:
这里的 (\tau) 是给定 (X_i) 后的条件平均差异,并不会自动成为因果效应;(\varepsilon_i) 提醒你仍有未记录的因素。若关键的处理前差异缺失,或把处理后的机制当作控制,系数的因果解释就会失去基础。
南桥案例首先是一个微观计量问题:每一行记录对应一位青年,林澈关心的是培训状态改变后,个体的稳定就业是否不同。此时,“谁接受了什么处理、结果在多长窗口内测量”比“全市平均数字有没有变化”更重要,因为研究对象就是具体的人和具体的选择。
但只要把问题换成“这项计划会不会改善南桥市整体就业”,单位就变了。失业率、岗位总量、企业招聘节奏和物价,都是城市—时期层面的变量;它们会同时受到产业周期、季节招聘和其他政策影响。你不能把一组青年之间的比较,直接翻译成一座城市的宏观结论。
林澈还要警惕外溢。完成培训的青年可能因为获得推荐而占据原本会给其他人的岗位,也可能把求职信息分享给未完训的朋友;前一种情况会改变竞争,后一种情况会扩散帮助。这样一来,“未完训组”未必完全没有受到项目影响,比较的含义就需要重新说明。
在写结论前,她会用下面这张小检查单确认研究能说到哪里:
因此,一项个体层面的结果最稳妥的说法通常是:“在南桥当前项目和样本范围内,培训与稳定就业之间呈现出怎样的可比差异。”它可以为政策提供线索,却不能跳过外溢、环境变化和实施条件,直接承诺所有城市都会得到同样结果。

林澈没有从回归开始。她先访谈项目流程,画出报名、获邀、开课、退出和就业记录的时间线;随后检查处理组和比较组在培训前是否有重叠。制度规则告诉她谁可能被比较,数据质量决定这种比较能否被落实。
当一个合理规格得出结果后,研究仍未结束。她需要改变有依据的样本限制或变量口径,检查结论是否依赖少数街区或少量记录;随后把发现、限制和不能推出的判断一起写出,而不是只挑最顺眼的一版。
林澈最终面对的不是一个可以脱离背景的数字。有限样本会波动,收入与就业记录可能误测,不同合理的定义也可能得到不同估计。窄的统计范围不能修复遗漏变量,宽的范围也不等于项目毫无作用。
因此,她给决策者的表述必须同时说明研究对象、处理、比较、时间和限制。若比较组没有重叠,或结果记录系统性缺失,最诚实的结论不是“模型失败”,而是现有资料不足以支撑强因果判断。

现在请你替林澈写一张研究卡,不要编造任何项目结果。让没有参与过研究的人也能看懂:你要比较什么,未完训者为何可能提供反事实,以及哪一个替代解释最值得继续调查。
提交前,回看你的语言是否与证据强度相称。若对象、处理、数据口径或比较依据仍说不清,就应回到研究设计,而不是急着让软件给出一个系数;清楚地缩小结论,比含糊地扩大结论更有价值。