自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

计量经济学

  1. 01计量经济学导论
  2. 02线性回归模型
  3. 03最小二乘法
  4. 04假设检验与模型选择
  5. 05函数形式与结构变化
  6. 06广义回归模型与异方差性
  7. 07方程系统
  8. 08面板数据模型
  9. 09估计框架
  10. 10广义矩估计
  11. 11极大似然估计
  12. 12离散选择和事件计数
  13. 13有限因变量
  14. 14序列相关性
  15. 15非平稳数据
正在加载课程章节内容
课程经济学计量经济学面板数据模型

面板数据模型

welearn-55817381.png

南桥市自 2021 年启动了“青年技能跃迁计划”,希望帮助本地青年提升技能、促进更稳定的就业。林澈接触这项计划时,并没有急于判断成效,而是提出一个更根本的问题:如果同一位青年在不同时间被持续追踪,我们究竟能够观察到哪些具体的变化?她发现,数据真正带来的不是一个抽象的统计系数,而是一段真实可追溯的成长路径——从临时工作、参加培训,到成功就业,实现收入和岗位的稳定。

在分析过程中,林澈关注的重点不仅是单个青年的变化,还包括这些变化是如何与城市的整体环境相互作用的。只有将个体经历与当时城市背景结合起来,才能判断某些变化到底是计划引起的,还是社会大环境的共同趋势。这样的视角,让她学会从有限的数据出发,既关注微观的个人提升,也不忽视宏观的背景流动。

需要说明的是,本章所用的案例、人物、数值和相关比例均为教学模拟。你将在以下内容中,跟随林澈连续观察同一批青年,从他们的多期数据出发,反复练习如何用有限且真实的面板数据,提出并回答精准的问题,从而提升实际分析的能力。


从同一人出发

纸艺数据拼贴图:匿名青年 A017 和 B052 在 2020 秋、2021 秋、2022 春被持续追踪,展示面板数据的纵向轨迹。

青年 A017 在 2020 年秋做临时配送,2021 年秋完成培训,2022 年春进入维修企业。林澈看到的不是三份互不相干的问卷,而是同一位青年穿过三个时点的选择。匿名编号把这些记录连起来,才让“他后来更稳定了吗”成为可分析的问题。

青年编号调查期是否已获服务稳定就业月收入(元)基线学历
A0172020 秋否否3,200中专
A0172021 秋是是4,100中专
A0172022 春是是4,650中专
B0522020 秋否是3,700大专
B0522021 秋否是4,050大专

表内数值均为教学模拟。面板让林澈看见 A017 是否改变,也让她保留 B052 的同期经历;但它不会自动说明改变由谁造成。家庭支持、季节招聘和城市景气都可能同时写进这条轨迹,后面的比较必须逐一处理它们。


先看变化

若只看 2022 年春,参加者收入较高,可能只是他们原本更会找工作;若只看 A017 的前后收入,又可能只是南桥市整体岗位增加。林澈需要两面镜子:同一青年自己的过去,以及同一时期未获服务青年所面对的共同环境。

DiD 账本教学模拟收入(元)这一步留下什么
处理组的前后变化4,900 − 3,800 = +1,100处理组从自身起点出发的变化
对照组的同期变化4,300 − 3,700 = +600未获服务者经历的共同变化
两个变化再相减+1,100 − +600 = +500共同变化后的额外差异

教学模拟的 +500 元不是计划效果的自动证明。它只在一个关键设想下有解释力:没有计划时,处理组和对照组会以可比的平均趋势前进。林澈因此先研究谁没被服务、为何没被服务,以及他们是否同样受到招聘季和岗位信息扩散影响。


认识基线

林澈在第一次清洗数据时,只做一件看似枯燥却最重要的事:核对“青年编号 + 调查期”是否唯一。她还把稳定就业的判定窗口、收入的回忆期、访谈日期和服务日期放到同一张数据字典里,避免把口径变化误当成青年处境改变。

个人面板追踪的是同一位青年,因此可利用他的基线;重复横截面每期抽到相似人群,却未必还是同一批人。前者能更直接地处理稳定个人差异,后者则更依赖组别构成没有在时间里悄悄换人。南桥案例采用前者,也就必须认真面对流失。

分析步骤

  • 先核验每个青年—时期组合唯一,再合并培训、问卷和就业记录。
  • 分别保留报名、开课、结业和岗位推荐日期,不把它们压成含混的“参加”。
  • 统一稳定就业与收入的定义,并记录每次问卷或行政口径的变动。
  • 区分拒答、迁出、无法联系和系统错误,让缺失原因可被审计。
  • 回查重复记录、收入单位错填和日期倒置,再开始任何模型估计。
  • 以同一青年跨期线图核对服务前是否已有异常跳变,再决定是否进入事件研究。

留住不变项

合并 OLS 会把所有青年—时期记录摊在一起:Yit=βDit+γ′Xit+uitY_{it}=\beta D_{it}+\gamma'X_{it}+u_{it}Yit​=βDit​+γ′Xit​+uit​。它不显式区分组内与组间变异,也未建模长期个人成分。林澈把 A017 和 B052混在同一回归里时,无法知道收入差异有多少来自培训,多少来自他们一直不同的起跑线。

加入个人效应 aia_iai​ 与时期效应 λt\lambda_tλt​ 后,模型为 Yit=βDit+γ′Xit+ai+λt+εitY_{it}=\beta D_{it}+\gamma'X_{it}+a_i+\lambda_t+\varepsilon_{it}Yit​=βDit​+γ′Xit​+ai​+λt​+εit​。aia_iai​ 像每位青年稳定的求职动力和家庭资源,λt\lambda_tλt​ 像同一时期全城共同的招聘季、交通变化或问卷调整。

Yit−Yˉi=β(Dit−Dˉi)+γ′(Xit−Xˉi)+(λt−λˉi)+(εit−εˉi)Y_{it}-\bar Y_i=\beta(D_{it}-\bar D_i)+\gamma'(X_{it}-\bar X_i)+(\lambda_t-\bar\lambda_i)+(\varepsilon_{it}-\bar\varepsilon_i)Yit​−Yˉi​=β(Dit​−Dˉi​)+γ′(Xit​−Xˉi​)+(λt​−λˉi​)+(εit​−εˉi​)

深蓝纸艺图:小周和小贺的原始收入轨迹各自减去个人均值后围绕零线波动,不变特质被划去。

组内变换让 A017 与自己的通常水平比较,稳定不变的 aia_iai​ 因而被消掉。λˉi\bar\lambda_iλˉi​ 是该青年实际观察期内时期效应的平均值;实际估计可在未变换方程同时吸收个人和时期固定效应。性别或基线学历不变,便不能在这种比较中估出单独斜率。


固定还是随机

林澈担心那些更主动、家庭资源更丰富的青年更愿意报名参加培训,而这些性格、社会背景等长期特质往往难以在问卷中被完全观测和记录。如果忽略这些不可见差异,比较不同人的结果可能会产生偏差。固定效应模型则允许这些难以全面捕捉的个人特质与是否接受服务相关,从而主要依靠“同一个人”自身的前后变化进行比较。这样,分析重心就在于:同一个青年从未获服务到接受服务之后,他的收入、就业等结果与自己过去的起点相比,有没有明显的偏移或提升。

此外,固定效应也有局限。例如,它没法分析那些不会随时间变化的变量(如性别、出生地)本身的影响,因为这些特征被模型吸收了。如果想要研究这些稳定属性与结果变量的关系,就需要借助其他方法或设计。因此,林澈在利用固定效应时,也会综合考虑模型限制和研究问题,权衡使用不同的统计工具。

视角主要利用的比较对长期个人差异的要求
合并 OLS不同人、不同期的混合差异未单独建模
固定效应同一青年跨期的偏离可与处理和控制变量相关
随机效应组内与组间信息共同利用必须与整条处理和控制轨迹不相关
不变特征可描述组间关联在个人固定效应中被吸收

随机效应要求 Cov⁡ ⁣(ai,(Di1,…,DiT,Xi1′,…,XiT′))=0\operatorname{Cov}\!\left(a_i,(D_{i1},\ldots,D_{iT},X_{i1}',\ldots,X_{iT}')\right)=0Cov(ai​,(Di1​,…,DiT​,Xi1′​,…,XiT′​))=0,还要求暂时扰动 εit\varepsilon_{it}εit​ 在给定 aia_iai​、整条 DDD 与 XXX 轨迹后条件均值为零。若固定效应与随机效应差异很大,林澈不会挑更好看的答案,而会追问组内和组间关系为何不同。


把政策变成设计

蓝色处理组与橙色对照组在政策前平行上升,政策实施后处理组出现额外上升的差分中的差分示意图。

林澈在设计政策评估时,首先明确了“处理”变量的定义。她坚持将“实际获得服务”的时间点作为处理起始,而非简单以报名或申请时间代替。这样能统一服务发生时点,但不能自动排除宣传、报名或准备期的提前反应;仍须检查无预期假设,并按机制界定处理。模型表达为 Yit=ai+λt+βDit+γ′Xit+εitY_{it}=a_i+\lambda_t+\beta D_{it}+\gamma'X_{it}+\varepsilon_{it}Yit​=ai​+λt​+βDit​+γ′Xit​+εit​,其中 aia_iai​ 保留每位青年的稳定特质,λt\lambda_tλt​ 保持各时点的整体波动,β\betaβ 则捕捉服务状态的效应,体现了“差分中的差分”(DiD)设计对个体相对变化的关注。

在界定处理组的同时,林澈更重视对照组的构建和甄别。例如,她不会将 B052 简单视作“未参加者”而直接纳入对照,而是进一步追问:B052 是否因为不具备资格、已经获得了稳定就业、或虽未上课却通过朋友获得了类似帮助?如果这些情形成立,B052 就难以成为A017理想的对照。只有那些在未获服务时,其发展趋势足以代表A017反事实路径的青年,才能构成可信的对照组,否则会引入系统性偏差。

此外,林澈还会反思“处理”和“对照”的背景条件。例如,某些青年获得服务可能并非完全随机,而是受资格筛选、行业偏好、宣传覆盖等影响。同样地,部分未获服务者本身可能已拥有优越资源或路径,使其并非典型对照。如果不加甄别便统一比较,DiD估计的β\betaβ可能夹杂选择性偏差。因此,她在每次分析前,都细致梳理处理转化路径和对照筛选标准,确保政策评价建立在扎实、有解释力的设计之上。

分析步骤

写清主处理是资格、开课、完成还是岗位推荐,替代定义只作为敏感性检查。
画出宣传、报名、开课、结业和访谈的时间线,避免把提前反应错记为效果。
说明对照为何面对相近劳动力市场,又为何没有被服务或信息溢出覆盖。
把证书和岗位推荐等处理后变量当作可能机制,避免机械控制掉项目路径。
将资格规则、名额分配与街道产业冲击写入设计说明,而不只写进回归命令。
在首次估计前确定主比较和敏感性窗口,避免看见结果后再改变故事。

检验趋势

事件研究在单一处理批次或处理效应动态可合理视为同质时,把“处理后”拆成相对处理期。令 gig_igi​ 为首次实际服务期,k=t−gik=t-g_ik=t−gi​;从未服务者取 gi=∞g_i=\inftygi​=∞,其全部相对期指示变量 1{t−gi=k}1\{t-g_i=k\}1{t−gi​=k} 均为 0。

选处理前一期为参照,可写为 Yit=ai+λt+∑k≠−1βk1{t−gi=k}+γ′Xit+εitY_{it}=a_i+\lambda_t+\sum_{k\ne-1}\beta_k1\{t-g_i=k\}+\gamma'X_{it}+\varepsilon_{it}Yit​=ai​+λt​+∑k=−1​βk​1{t−gi​=k}+γ′Xit​+εit​。若分批实施且动态异质,不能直接按传统 TWFE 解释,应以尚未处理或从未处理者构造批次—相对时间比较,再说明最终如何汇总。

事件研究警示卡 前置项接近零只表示有限窗口里没有看见明显偏离,并不证明反事实趋势。录取、开课和岗位推荐若不在同一天,事件零点必须对应理论上开始影响结果的时刻。

林澈读图时先看处理前是否连续分叉,再看处理后路径是否符合课程机制。培训可能先占用工时,收入短期不升反降,结业后才改善匹配;稳定就业也可能先于收入上升。图形帮助她理解动态,却不会消除提前报名、流失或溢出。


面对分批实施

南桥市若让北岸先开班、中城后开班、南站更晚开班,林澈就拥有更多时点,也承担更多比较风险。早获服务青年不能在已经受服务后,被机械当作晚获服务青年的对照;一旦效果随时长或批次改变,传统双向固定效应的单一平均数会混入难以解释的比较。

黑板纸艺时间线:东河、云港、青岚三个街道依次开始服务,标出尚未处理、刚开始和已处理,并提醒已处理者不等于对照。

面对分批实施,建议采取如下更严谨的分析步骤:

每一批次分析时,将同一批次、处于同一相对服务时间的青年,与尚未处理或从未处理的青年进行比较,确保“对照”未受服务影响。

每一轮都要用干净对照,只有这样才能产生可信的组间变化度量。

针对不同批次、不同服务时长的效应结果,是否加总或加权,需要基于对各自反事实路径差异的充分理解后谨慎决定。

注意以下限制:

  • 随着时间推移若所有街道都已开班,后期就难以再获得“干净”的对照组。
  • 某些街道因就业形势变化提前启动,这类内生变化无法通过简单更换统计命令加以解决。

除了时间和分组本身,还要重视赋值机制背后的制度和实际环境。例如,当分批次推进可能受限于政策分配规则、预算到位时间以及各街道的实际办班能力时,这些客观约束影响了哪些青年能率先获得服务、谁又不得不等待。林澈会详细记录每个街道的配额制度、资金拨付节点、各机构容量变化、及行业性冲击等信息,这帮助她从源头判断分批顺序是否近似外生,也避免将制度性差异误当作政策纯粹效果。

在读者理解层面,林澈重视让结果回到实际样本和叙事。她会在汇总整体政策效应时,明确区分哪些指标代表了“早期受益者”、“晚期新晋青年”或“整个推进期内的平均受服务时长”,以免简单地把所有处理后记录压成一个看似统一的数值。通过交待每批处理背后的真实特征和现实差别,分析才能反映复杂动态背景下政策的真实影响。


让推断可靠

同一青年今天的未观察求职状态,往往与下月相关;同一街道的青年也会共同经历招聘会、企业停产或交通变化。林澈不能把每一行当成独立抽签结果。若课程资格按街道推出,独立政策冲击更接近街道数,而不是青年—月份记录数。

你看到的相关应先问什么推断上的含义
同一青年反复回答残差会否跨期相连需要允许青年内相关
街道统一开班处理在哪一层赋值街道是聚类的首要候选
行业共同波动残差是否跨街道共振需要检查额外相关来源
街道数量很少独立冲击是否有限常规区间可能过于乐观
固定嵌套层级街道是否包含青年重复观察街道聚类已容纳青年跨期相关
不嵌套相关维度是否有另一种共同冲击依据才讨论多维聚类

三个街道聚类的网络图:青年记录跨期相连,并由同一街道的招聘会、工厂或交通冲击共同影响,提示按街道聚类。

当街道是固定嵌套层级时,按街道聚类已允许同一青年跨期相关;只有存在不嵌套的相关维度且各自有依据时,才考虑多维聚类。少数街道不能被很多青年记录“放大”为很多独立实验,结果表必须同时写出聚类层级与聚类数量。

分析步骤

  • 从处理赋值、抽样方式和共同冲击三处写下可能相关的层级。
  • 先选能覆盖主要赋值层级的聚类方案,再检查是否存在有依据的不嵌套相关。
  • 报告聚类数量,不让读者把大量观测行误读为大量独立冲击。
  • 少数聚类时采用与设计相符的保守推断,并降低结论的确定语气。
  • 区分固定嵌套与真正不嵌套的相关来源,不把层级名称误作多维问题。

对待缺失

在青年跟踪过程中,数据往往并非总是完整顺畅。有时是学员在结业后迁出,也可能是部分访谈季度未能取得联系,或者个别问题遭遇拒答,甚至在行政数据整合步骤中出现技术合并失败。这些“断点”背后反映着多种实际情况:有人彻底失联,有人阶段性缺访,也有人仅在个别数据项上空缺。林澈始终注意,不同类型的缺失其实源于不同的制度、社会和技术原因,它们对最终评估结果的影响可能大不相同。

比如,若因课程安排或个人变化,处理组青年更倾向于流失,且这些流失者本身就业表现较差,有可能导致剩下可用数据表现出比真实影响更乐观的效果。这种现象的影响,会随对照组流失状况、课程对留存的促进作用及分析时选取的子样本而变化。林澈重视在分析和报告中呈现数据流失的实际情况——例如主样本和完整追踪样本会分别描述,帮助外部读者更全面理解样本代表性和分析不确定性的来源。

留存、拒答和迁出背后的多种原因,反映了数据收集和服务过程中的结构性挑战,具体表现为:

  • 不同街道或不同时段的问卷版本有所调整
  • 行政口径发生变动
  • 追访窗口时间有所调整

这些因素都会影响缺失数据的分布和可比性。林澈会在数据字典中清晰地标注与衡量、记录、追踪相关的关键节点,帮助后续使用者辨别信息断裂发生的时间、位置和可能原因。

她认为,承认和解释缺失是促进透明、公正与科学解释的重要环节。即使最细致的模型补全,也无法完全消除这种不确定性;对数据流失的敏感理解和开放报告,是每一位有责任心研究者必须面对的现实任务。


读懂结果

假设收入处理系数为 +480 元,按预先设定聚类层级构造的 95% 置信区间为 +120 到 +840 元;稳定就业线性概率系数为 +0.06,相应区间为 +0.01 到 +0.11。两组结果均为教学模拟,前者是样本内收入差异,后者是稳定就业概率相差 6 个百分点。

教学模拟回归结果的纸艺阅读路径图:从样本与处理、固定效应、趋势证据、聚类推断依次走向谨慎结论。

林澈先读样本、服务定义和反事实来源,再读趋势证据与区间,最后才读系数。她不会把正系数讲成每位青年都会受益,也不会把前置项不显著讲成因果已经证明。区间告诉她数据仍允许哪些效果范围,设计告诉她这些范围能解释到哪里。

收入增加也要放回工作时长、岗位类型和服务质量中理解。若增长来自短期加班,含义不同于转入可持续岗位;若课程只对部分青年真正送达,平均数还会遮住实施问题。模型给出一块证据,不能替代成本、权益和公平判断。

上一章方程系统下一章估计框架