南桥市 2021 年“青年技能跃迁计划”是一份教学模拟:林澈记录训练小时、入组前经验、稳定工作与收入。她并不急着问“培训有效吗”,而是先问:训练从 6 小时到 16 小时,与从 66 小时到 76 小时,是否应被同样对待?
阅读路线很简单。先看关系是否像直线,再判断是尺度、弯曲、群体差异还是时期变化在起作用;每走一步,都把样本覆盖、残差和可替代解释带在身边。这里的数字和人物只用于练习,不代表真实项目事实。

林澈把学员按训练时数分成几段,发现稳定工作比例在前段上升较快,后段逐渐变平。她没有立刻宣布“高时数无效”,而是先数每段有几人;若 80 小时以上只剩少数完成者,曲线尾端的形状很可能不稳定。
她又把点按经验组和入组季度着色。若同样的弯曲只出现在某一班,课程记录或招募规则比函数形式更值得追问;若多批样本都呈现类似走向,才有理由让模型放松“每小时同样变化”的假定。
对稳定工作这一结果,林澈先保留最容易解释的参照:在背景变量相同的条件下,训练小时每增加一单位,预测概率按同一斜率变化。直线不是默认真相,而是一个能被残差图、关键点预测和后续比较共同推翻的起点;若它给出小于 0 或大于 1 的预测,就应改用合适的二元结果模型或受限预测。
她把同一份稳定工作样本、同一组控制变量和同一评估尺度固定下来,再只替换训练时数的写法。收入模型可以单独讨论比例尺度,却不能同稳定工作概率模型混在一张“最佳模型”排行榜里。
林澈拿收入作第二个结果。3,000 到 4,000 元和 13,000 到 14,000 元都多 1,000 元,但相对变化不同;对结果取 是在比例或乘法尺度上阅读收入,它并不自动表示训练越多、每小时回报越小。
若她认为前几小时训练最能帮助学员,可对解释变量取 ,也可用凹二次或分段关系。这里的 必须全为正;若存在 0 小时,必须在研究设计阶段采用有理论依据、预先声明的处理,不能直接取对数。另设正收入模型 ,其中h不取对数;一小时对应条件几何均值的精确比例变化是 ;相差 小时才用 。算术均值的重变换还须处理误差分布。零收入不能无声删除,必须说明分析对象是否已变成就业者。
在模拟图里,林澈不满足于“二次项为负”。她把训练时数减去平均值,记为 ,让平均训练时数成为可读的参考点;随后比较 20、48、70 小时的条件预测,并在高时数处把不确定区间和样本量一起展示。
在任何中心化时数 ,局部斜率是 ;训练再多一小时,斜率本身改变 。因此曲率的结论不该是一颗星号,而应是“在哪些小时点仍有增量、这些点是否被样本覆盖”的连贯判断。

作品集模块在 48 小时完成,给了林澈一个可以事先说明的节点。她可把超过 48 小时的部分单独写入模型,于是节点前后允许不同斜率;这描述课程过程可能改变增量速度,并不自动证明 47 与 48 小时的青年存在可识别的因果跳跃。
如果节点仅因图上看起来好看,就不该写成制度门槛。林澈会检查节点两侧人数、谁更可能坚持到后段、调整合理节点后故事是否翻转;没有单一课程节点而曲线仍平滑弯曲时,少量结点的样条往往比高阶多项式更贴近这一问题。
林澈发现有相关经验的青年起点可能更高,却不意味着他们每多一小时训练的变化也相同。她把训练时数中心化后与经验指标相乘,使“参考训练时数”成为两组都能理解的比较点,而不是难以解释的零小时。
经验不足组的小时斜率是 ,经验组是 ; 则是参考时数处的水平差。林澈不只读 的符号,而是画两条预测线,在 20、48、70 小时逐点比较,并提醒读者:班次选择、完成能力和求职动机仍可能同时影响经验、时数与结果。
教学情境把劳动力市场收紧设在 2022 年初。林澈先检查每季的结果口径、缺失率、训练时数和经验构成;若这些同时改变,前后差异未必来自行为机制,可能只是样本换了人或随访方式变了。
她把训练时数以 6 小时中心化,记作 。在 中, 是训练 6 小时处的前后预测水平差, 是训练斜率的变化。它仍是条件关联的比较;没有可比组和可信识别条件,就不能把它叫作冲击或培训的因果效应。

在判断模型关系是否在不同阶段或样本下保持稳定时,下方梳理出一套系统性的关键步骤帮助分析和交流:
明确断点来源
分析检验结果背后的原因
结论需结合教学情境与透明解释
这样可条理清晰地展现诊断关系稳定性的流程与注意事项。

林澈最后交付的不是模型冠军,而是一份能被别人重做的判断记录。它把函数选择、关键点预测、交互解释和结构稳定性串在一起,也让读者知道哪一部分来自教学情境、哪一部分仍只是有条件的描述。
若后续批次的预测表现变差,或换一个合理节点后曲线翻转,正确反应是回到数据口径和样本覆盖,而非继续寻找更漂亮的系数。下一章才会进一步处理误差在不同群体和时期是否同样稳定的问题。
