南桥市于 2021 年推出了“青年技能跃迁计划”,旨在帮助本地青年提升职业技能、增强就业能力。林澈关注的核心问题是,参加培训是否真的能提高稳定工作的比例与劳动收入。然而须明确,本章涉及的人物、制度和数据均为教学模拟,目的在于帮助读者理解实际评估中可能遇到的内生性和选择偏差。
在正式分析数据、进行回归推断之前,林澈提出了更基础的疑问:青年为何报名参加培训,顾问为何邀请或推荐某些人,以及企业又为何更愿意招聘特定的培训学员?这些选择过程是否交织在一起,共同影响我们最终所观察到的培训参与记录,从而对后续的推断带来偏差?

阿岚在白板上先画出一条朴素路径:培训帮助青年掌握技能,技能提高稳定就业。林澈随即补上几条线:更有把握的青年更愿报名,顾问会依据近期表现追加支持,企业招聘回暖同时增加上课意愿与录用机会。原先的一条箭头立刻变成有反馈的网络。
这种反馈通常按月发生,而非瞬间闭合。岗位消息影响本月报名,报名名单影响下月班次,班次与顾问安排又改变求职节奏。研究者若只在一年后看“完训”和“就业”,很容易把此前已经相互作用的选择过程,误读成培训从外部单独造成的差异。
林澈因此把“谁先观察到什么”写在每条箭头旁。青年知道自己的照护责任,顾问知道部分简历细节,企业知道下季用工计划,研究者只看到其中一小部分。看不见并不代表不存在;它恰好解释了为什么完训者与未完训者不能天然视作可直接交换的两组人。
林澈首先把“稳定工作”作为结果变量,培训完成状况(完训)放在右侧作为主要解释变量,但她不因此就假设完训是完全外生决定的。第一,任何未观测到的因素——比如青年的主动性、健康状况、家庭支持、与顾问的私人判断——只要这些因素既影响青年是否能顺利完训,也同样影响他们找到稳定工作的概率,那么,培训变量 在作为解释变量时就自动夹带了这些额外的信息。普通的线性回归此时估出来的“培训效应”,其实包含了培训本身与这些混杂因素的合成效应。
其次,这一内生性问题可以用更形式化的方式表达:如果像主动性 这样的变量没有被我们观测,而它既影响(接受培训的选择或完成情况),又影响(稳定工作的获取),那么与误差项就相关了。换句话说,回归里“培训”变量事实上混杂了这些看不见的背景因素,违反了回归识别因果效应所要求的外生性假设。
公式能够描述这种担忧,却并不能替我们明确方向:比如,有的情况下,失业者因困境更愿报名(可能出现负向偏差),但也可能主动者更易报名并顺利完训(可能出现正向偏差)。这些复杂的内生过程与选择路径,只有回到项目实际流程和数据生成过程,才能被逐步梳理清楚。
林澈接着把“谁先知道什么”写进结构关系。 表示青年决定是否培训时掌握的信息,因此对稳定工作和收入的预期不应被混成一个模糊的期待项。两种预期以各自系数进入培训选择,正是为了保留“预期结果反过来影响处理”的可能。
只有给定并代入预期形成规则后,以下关系才能作为线性教学闭合来处理。若完训与稳定工作采用二元观测口径,线性形式只是概率尺度或线性投影近似;它服务于识别直觉,并不把青年复杂的二元选择宣称为完整模型。
给定预期规则且采用线性近似时,令 ,系统可写成 ,并化为 。约化式描述外部输入后各结果的共同响应; 是结构参数的组合,不应被不加说明地读成培训效应。

阿岚问:“既然方程都写出来了,为什么不能直接求解呢?”林澈解释说,虽然方程组的代数解可以在一套假设下算出来,甚至用软件得到一个具体数值,但这些数值只是反映了我们选择的前提和设定。如果好几种培训效应都能用同一组观测数据来“解释”,那软件输出的数字并不能证明某个解释就是对的,而只是选定的一种设定下的结果。没有外部线索,数据本身并不能识别出唯一的效应。
“能否区分不同假设,关键看识别(identification)。”林澈补充。仅凭变量名称或简单设定不够,真正的识别需要有一个可被追溯、清楚描述的外部拨动(外生变化)。这个外部变化要能首先影响到培训,却不会通过其他路径(比如直接影响就业或收入)同时引入其他扰动因素。仅靠一堆变量名或足量工具变量的列举不足以说明问题——关键是每个工具在控制已知条件后,还能否带来“干净”的、真实不同的处理变异。
以南桥的批次规则为例,需要重点审查以下几个方面:
如果上述因素之一发生变化,批次的作用就超出了“只推动培训”的范畴。林澈提醒,若这些外部拨动不仅影响是否参加培训,还导致多项配套变化,那么最终分析得到的是“整个批次带来的服务组合”效果,而不是单纯的完训本身的因果效应。
另外,审查和区分这些外部拨动,需要结合制度细节、实际操作记录和对供应链各环节的细致理解。不能只在回归表中找显著星号或相信技术术语,真正的判别要落脚于流程、例外机制、实际干预细节及其在数据中的映射。只有在逐条核实和记录外生变化的前提下,才能让结构方程背后的识别假设经得起实践和同行评议的考验。

南桥教学案例中的候选外部变化,是报名结束前由可审计随机程序产生的预约批次。它决定青年可预约的入学时段;若排程没有使用潜在结果信息,研究者才有理由把批次看作可能来自系统外部的推力,而不是顾问已知就业前景的另一种编码。
不过批次只有在不改变课程版本、讲师或容量、就业市场日历、随访窗口以及附带服务时,才可能只通过培训起作用。若早批次恰好赶上招聘季,或得到不同讲师与岗位推送,观察到的结果就混入了这些通道;林澈必须把它们逐条写在因果图上。
审计步骤

工具变量的难处不在于找到一个与完训相关的字段,而在于让这个相关性只留下培训通道。林澈先让团队写出“它为什么会失败”:页面可能同时推送岗位,改期可能照顾就业困难者,课程容量可能随批次波动。先写反例,才能知道要保存哪些证据。
工具可以先改变“收到入口”,再由入口影响是否完训;入口是工具,完训才是预先固定的处理。只要入口确实推动完训,且除通过完训外不影响稳定工作或收入,IV 仍以完训为处理。若入口同时推送岗位、补贴或额外顾问服务,它就有直接路径,不能把入口和完训混成同一个处理。
林澈特别要求先写“若工具无效,最可能在哪儿失效”。早批次可能收到不同提醒,人工改期可能优先照顾处境困难者,课程排期可能跨越不同招聘季。把这些反例放在结果表之前,能迫使团队从制度证据而非软件输出开始判断识别是否可信。
两阶段最小二乘的直觉是先从完训中取出由批次推动的那部分变化,再看稳定工作是否随这一变化移动。它避开的不是所有不确定性,而是与青年自我选择纠缠的那部分处理变异;因此,第一阶段是否真实、清楚而足够强,决定了第二阶段能说多远。
第一阶段同时放入工具和入组前外生条件,形成 ;第二阶段用这部分变化解释稳定工作。在同一样本、相同工具和控制变量设定下,手工两步回归得到相同的2SLS点估计,却会漏掉第一阶段估计的不确定性,完整 IV 程序与符合实施层级的方差处理不可省略。
在报告中,林澈先展示批次改变了多少完训机会,再展示由此带出的稳定工作变化,最后说明样本、聚类层级和区间。这样的顺序让管理者看见证据如何传递,而不是只看到一行看似精确的第二阶段系数。

假设在一次教学模拟中,采用随机入口(工具变量)使训练学员的完训率提升了 12 个百分点,同时观察到稳定工作率上升了 4 个百分点。需要注意的是,林澈不会简单地解读为“每位青年都直接获得了 4 个百分点的提升”,因为实际上,入口的随机分配只是影响了部分原本不会完训的青年,并非所有人都因此改变了状态。她特别关注的,是那些因为入口变化从“未完训”转变为“完训”的群体。
在工具变量分析中,只要满足随机分配的独立性、排除限制、单调性、明确处理定义和无干扰等关键条件,我们可以定义“局部平均处理效应”(LATE, Local Average Treatment Effect)。在本例中,这个效应的计算方式为:
这意味着,对因入口干预而完成培训的青年来说,平均稳定工作概率提升约 33.3 个百分点。需要特别强调,这个估计值仅适用于因工具变量诱发行为改变的子集,即“complier”群体,并不能直接外推出坚定报名者、所有课程类型,或者不同年份的所有青年,更不能承诺个体层面必然获得同样的效果。
当最终结果变量是二元(如是否稳定工作),线性 IV(工具变量)方法在上述假设下可用于估计概率尺度上的局部效应。若分析收入等连续或分类型结果,则需要进一步区分“零收入”、“未观察”与“有收入”等状态。在存在删失(censoring)或其他非线性结果变量时,线性 2SLS 只是对实际效应的线性投影。若选择用线性结果近似,或考虑采用其他更复杂的模型,都应事先明确说明所要估计的对象和实际含义,并对结果解释加以限定和说明。
批次若几乎不改变完训,第二阶段便只靠极少的有效变化推断就业,估计会摇摆且区间会变宽。即使最终系数带有显著标记,也不能说明工具足够强;在有限样本中,弱工具还可能把结果拉回受到内生性影响的朴素关系。
林澈会把弱工具当作信息不足,而不是计算技巧问题。她查看第一阶段系数与区间、不同批次和培训点的覆盖、控制协变量后的独立解释力,并使用适合异方差或聚类设定的诊断与推断;若证据不足,最诚实的结论是无法精确估计。
复核步骤

在分析多个结果变量时,研究者常常会思考:是否需要搭建联立方程系统,还是可以分别估计每个结果?其实,并非所有多结果情形都需要联立因果模型。例如,稳定工作与收入往往会受到同一轮行业景气等宏观因素的影响,这会导致它们的误差项相关,但右侧自变量未必有互相决定的因果关系。这种情况下,我们只需要关注误差相关,而不一定要假设存在直接的反馈或同时性。
只有在“右侧变量之间存在因果联动”时,比如培训决策和就业预期相互影响,才需要联立系统和外部工具来解决同时性识别问题。如果仅仅是结果被相同的未观测因素共同影响,联合建模主要带来的是推断效率上的提升,而不是解决内生性或因果识别。
”似不相关“的经典方法如 SUR(似不相关回归,Seemingly Unrelated Regression)可以在误差项相关时提升估计联合分布的效率,但它并不能把本来内生的自变量变成外生。在同一样本且右侧变量完全一致的情况下,SUR/GLS 与对每个方程分别做 OLS 得到的系数其实是完全相同的;只有当每个方程包含不同的右侧变量,才有因为误差相关带来的效率收益。但此时每条方程的识别故事依然要单独成立,不能用效率提升替代因果逻辑。
即使识别结果已较为可信,林澈也坚持不会将局部平均效应直接当作个人决策标准。她注意到,历史样本中较低的完训率往往源自交通不便、照护压力、残障可及性有限,或是信息传递不足等结构性障碍;如果项目只优先服务“最容易成功的人”,原有的不平等和困难只会在后续的数据和资源分配中不断重复。
在南桥的教学模拟案例中,分析团队和服务团队被明确区分:研究者仅收集实现因果推断所需的最小化数据字段,其他敏感或异常信息由既有的支持和服务流程独立处理。对于随机流程中的突发情况,团队规定必须优先满足急需者的实际需求,确保分析流程不会拖延或阻断任何应得的帮助。
当面对推断证据仍有不确定、局部结果波动较大时,林澈更倾向于改进信息采集、规则日志、服务随访和可及性保障。她提醒团队,不能因为模型输出了一个有统计显著性的系数,就贸然用其自动决策――特别是涉及服务对象资格和资源分配时。
最终,最诚实的行动是公开披露证据局限,并在管理与服务流程中积极添补潜在的不公平和遗漏,让决策始终服务于最需要的人群,而不是依赖于“看起来最容易被解释”的分析结果。

本章的阅读顺序也是研究顺序:先在南桥案例里看见反馈,再判断培训为何内生;先审查批次能否提供外部变异,再进入两阶段估计;最后检查弱工具、外推边界和政策用途。方程系统并非让文字变成符号,而是防止我们把相互影响伪装为单向因果。
离开本章前,林澈仍保留四个问题:处理定义是否固定,工具是否只通过处理起作用,估计对象究竟是谁,假设失败时服务是否仍公平。下一章把观察延展到多个时间点时,这些问题会继续决定我们能否区分个人差异、共同冲击与真实的政策变化。