自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

计量经济学

  1. 01计量经济学导论
  2. 02线性回归模型
  3. 03最小二乘法
  4. 04假设检验与模型选择
  5. 05函数形式与结构变化
  6. 06广义回归模型与异方差性
  7. 07方程系统
  8. 08面板数据模型
  9. 09估计框架
  10. 10广义矩估计
  11. 11极大似然估计
  12. 12离散选择和事件计数
  13. 13有限因变量
  14. 14序列相关性
  15. 15非平稳数据
正在加载课程章节内容
课程经济学计量经济学序列相关性

序列相关性

南桥市 2021 年“青年技能跃迁计划”按月跟踪结业学员的就业率、首份工作时薪中位数、辅导完成情况和企业岗位数。林澈预先用 2020 年末及更早的教学模拟期建立基准模型;2021 年每到月末,她都把实际值与预测值的差记成残差。

她很快发现,模型二月偏乐观后,三月仍常偏乐观。一个没有被岗位数、辅导和批次解释的招聘收缩,似乎会留到下个月。本章讨论的正是这种“昨天还留在误差里”的情形,以及它会怎样改变推断和预测。

误差会留下记忆

南桥市就业率实际值与预测值的月度对比图,标出一至三月连续负残差和五至六月连续正残差

林澈先把 1—6 月的就业率残差排成一行:-0.9、-1.3、-1.3、-0.3、0.8、0.8 个百分点。前三个月连续为负,说明模型连续高估;五、六月连续为正,说明它又连续低估。相邻月份的错误不像独立抽签。

这不等于“每两个同号残差都是自相关”。小样本本来会偶然成串。真正值得注意的是,一段偏差是否有持续方向、是否与招聘审批或结业批次同时出现,以及它在补上可解释过程后是否减弱。

原始就业率平滑,也不能直接判为问题。就业率可能本来就受趋势和样本构成影响;只有控制了可观察因素以后,残差仍带着时间结构,才说明模型留下了可以继续追问的信息。

月份预测就业率实际就业率残差先追问的过程
1 月61.8%60.9%-0.9年初招聘是否收缩?
2 月63.0%61.7%-1.3上月面试是否积压?
3 月64.1%62.8%-1.3同一冲击是否仍在传递?
4 月64.8%64.5%-0.3偏差为何开始消退?
5 月65.2%66.0%0.8是否出现未记录的回暖?
6 月65.7%66.5%0.8回暖是偶然还是持续?

先读残差的形状

林澈没有一上来选择 AR 阶数。她先核对时间索引:这个“八月就业率”究竟按到岗月、报送月还是修订月记录?如果问卷在九月补回、却标在八月,表面上的连续性可能只是一条错位的时间轴。

接着,她把残差画成时间线,并把 ACF 放在旁边。时间线告诉她偏差是连续、交替还是断裂;ACF 告诉她相隔一月、两月的残差还像不像。两张图一起看,才不会把一个孤立的大点误读成长期记忆。

年周期在南桥的 2021 年单年度数据中只能是待检验候选。至少有两个完整年度,才能比较同月残差、识别或检验年周期;在那之前,已知招聘季附近的偏离只能提示你保存批次信息并继续积累数据。

诊断信号更像什么先核验什么暂时不要断言什么
连续同号短期景气或服务积压招聘、面试、结业记录某个系数必然错误
正负交替修订节奏或过度调节初报、终报与样本名单必定存在负 AR 过程
政策后整体上移口径或制度断点变更日期与覆盖人群这是随机余波
已知招聘/结业季附近偏离单年度中的偶然差异批次信息与第二个完整年度已识别年周期
单月极端新闻冲击或录入问题个案与数据质量高阶结构已经确定

包含残差时间图、滞后柱图、散点图和月份箱线图的四图诊断板


把图形变成问题

图形之后,检验才有合适的位置。Durbin–Watson 适合快速检查相邻残差是否异常相似;Breusch–Godfrey 型检验可追问多阶滞后残差是否仍有共同解释力;Ljung–Box 型检验把若干阶信息汇总,问残差整体是否还留着结构。

这些工具都在回答窄问题。p 值小表示值得继续查找过程和规格,p 值大则表示没有获得强反对所检验的无自相关假设的证据;无自相关也不等于独立;二者都不会自动告诉你遗漏了哪一项服务、哪次制度变化,或哪个月的数据被错放。

若你想把“本月和几月前是否同向”压缩为一个数,样本自相关就是这种压缩。它不制造因果关系,也不替代时间图;它只把残差与其滞后值的线性相似程度记录下来,供你与其他证据一起判断。

rk=∑(et−eˉ)(et−k−eˉ)/∑(et−eˉ)2r_k=\sum(e_t-\bar e)(e_{t-k}-\bar e)/\sum(e_t-\bar e)^2rk​=∑(et​−eˉ)(et−k​−eˉ)/∑(et​−eˉ)2

检验以后先回到现场

南桥的样本很短,林澈不会在检验显著后立刻加入五个滞后。她会先回到月度记录:结业批次是否集中、四月的记录方式是否改变、异常月是否由低回收率主导。被补上的机制,往往比新加的参数更能解释残差。

她也不会用 2021 年的十二个点测试十二期滞后。年周期只能作为候选保留,待至少积累第二个完整年度再比较同月模式。短样本中,把一个不重复的年度图形包装成“季节效应”,通常比承认不知道更危险。

在删去异常月、加入断点或加入批次信息后,她会重画同一张残差图。若短期连续性消失,说明原先的记忆部分来自可解释结构;若它仍稳定存在,才有理由考虑低阶动态或稳健推断。

核验动作应按顺序完成:

  • 固定发生日、报送日、修订日与预测原点。
  • 保存残差图、ACF 和异常月的过程备注。
  • 比较基准、断点和批次规格,不为显著性任意加阶。
  • 把年周期写成候选,等待第二个完整年度。
  • 用后续月份检查改动是否真的改善预测。

推断为什么会变窄

当解释变量本身也具备持续性,同时残差之间存在正的序列相关时,常规 OLS 标准误往往会被低估,结果是 t值绝对值偏高、置信区间变窄、p值偏低。这是因为模型假定的“独立同分布”条件被破坏,残差的相关性会让我们对回归系数的不确定度估计过于乐观。然而,标准误误差的方向其实并不是总能一眼判断,它受到解释变量与误差之间时序结构的具体影响,而并非只取决于自相关的正负号大小。

即使检验发现残差显著自相关,也不意味着 OLS 系数就完全失去参考价值。你需要重点区分以下几点:

  • 只要模型结构写得合理,且解释变量与误差间没有系统性关联,OLS 点估计通常仍然具有无偏性和线性属性;
  • 主要需要修正的,是推断的标准误、置信区间和显著性判断,而不是点估计本身;
  • 如果出现“辅导次数受到即将就业困难的预期影响提前调节”这类内生性行为,会引入新的问题,这些结构性相关性是 HAC 等稳健标准误不能解决的。

简而言之,自相关影响主要体现在推断不稳健上,而不是点估计的有效性;真正影响点估计无偏性的,是解释变量与误差的系统性关联(内生性)。

为了让团队理解残差相关的影响,林澈会把常规标准误给出的区间和考虑残差结构修正后(如 Newey-West 或 HAC)的区间在同一张表或图中并列展现。她强调点估计本身不变,但区间宽度、t 检验、p 值可能会有明显不同。团队需要明白哪些结论在考虑月度相关或统计稳健性后仍然成立,哪些只是在样本较小时出现的偶然现象。

她补充说明:只依靠星号和显著性未必安全,特别是在数据有限、残差明显不独立的情形下。每次检验后都应仔细解释推断的前提,分析哪些变量的影响在各种修正下最稳定,哪些则可能因弱序列、短样本或结构变动而仅供暂时参考。

同一点估计下常规区间较窄而稳健区间较宽的对比示意图


修正要匹配目的

HAC 的用途是修正既有回归的标准误,使区间对异方差和短程、随滞后衰减的序列相关更稳健。它通常保留 OLS 点估计,不会使残差自动变白,也不会替你预测七月岗位数;它回答的是“这组关联有多精确”。

GLS 式方法或回归加 AR 误差的目标不同。若误差结构有清楚依据,并且残差诊断支持它们,你可以利用该结构提高估计或预测效率;但若把断点、趋势或日期错位硬塞进 AR 结构,模型会把可解释变化伪装成随机记忆。

林澈因此先写下任务,再选工具。她若只需稳健区间,就比较少数合理 HAC 设定;她若要提高一步预测,才比较业务滞后和低阶误差动态。任何更复杂的设定,都必须在滚动预测中胜过透明的基准。

方案主要用途它不解决什么留给下一步的检验
OLS + HAC让区间与检验较稳健内生性、断点、未来输入带宽敏感性与区间变化
GLS / 可行 GLS利用可辩护协方差提高效率错设的误差结构参数稳定性与残差复查
回归 + AR 误差使用残余余波改善预测遗漏的业务过程创新残差是否更接近白噪声
业务滞后变量表达服务或市场的传导自动获得因果识别累计关联与可得信息
透明基准保持最少必要协变量与固定训练窗口隐藏的时间错位和新制度与复杂方案在同一预测原点滚动比较

先解释时间路径

职业辅导不是当月按下按钮、当月就全部变成就业。学员要改简历、投递、面试,企业也要审批和发 offer。若这条过程通常跨一两个月,把当前和过去的辅导次数写进均值关系,比让所有延迟都躲在残差里更容易解释。

林澈先把每一项读成一段路径。教学模拟中,当期、滞后一期、滞后二期的关联为 0.05、0.24、0.11,关注点不该是哪个月“赢了”,而是累计关联 0.05+0.24+0.11=0.400.05+0.24+0.11=0.400.05+0.24+0.11=0.40 是否稳定、是否符合求职流程。

这种时间顺序仍然不是因果许可证。项目组可能预见到招聘困难,才提前增加辅导;于是辅导与未来就业共享了未观察到的信息。动态项帮助你表达传导,不会替代对照、外生变化或其他识别设计。

yt=β0+θ0ct+θ1ct−1+θ2ct−2+δvt+ety_t=\beta_0+\theta_0 c_t+\theta_1 c_{t-1}+\theta_2 c_{t-2}+\delta v_t+e_tyt​=β0​+θ0​ct​+θ1​ct−1​+θ2​ct−2​+δvt​+et​

核验动态项时,请逐步完成:

  • 写出辅导、面试、offer、到岗各自发生的月份。
  • 限定与流程相符的一至两期滞后,不盲目加长。
  • 同时查看单期和累计关联,而不是只挑一个显著项。
  • 重画残差,确认遗漏的短期结构是否真的减弱。

南桥市学员从职业辅导到稳定上岗的流程,以及当期和两期滞后可能作用窗口


让误差接着走

业务滞后和 AR 误差要分开读。前者说“上月辅导或岗位会通过可解释流程影响今天”;后者说“控制这些变量后,仍有一部分未解释冲击会延续”。把上月就业率机械放进方程,可能掩盖景气、口径或样本构成变化。

一阶 AR 的直觉很简单:本月未解释偏差,等于上一月偏差的一部分,加上本月新发生的创新冲击。前一个部分允许保留记忆,后一个部分才应尽量接近白噪声。若新冲击不断到来,历史余波并不会保证未来按同一路径走。

另设一个与开篇不同的演算情景,五月残差为+1.2、ρ=0.5\rho=0.5ρ=0.5 时,在没有新冲击的条件下,六月会保留约 +0.6 的余波,七月旧余波约为 +0.3。这个条件计算能改善一步判断,却不能把政策断点或市场转向当作稳定参数的一部分。

ηt=ρηt−1+ut\eta_t=\rho\eta_{t-1}+u_tηt​=ρηt−1​+ut​

五月正向未解释冲击在六月和七月按零点六与零点三逐步衰减,同时每月加入新冲击的示意图


预测在月末开始

真正的预测必须站在当时的月末。本节的基准与动态候选模型由 2020 年末及更早的教学模拟期预先建立;在 2021 年 6 月 30 日预测 7 月时,林澈只能使用已完成辅导、已公布岗位计划、日历和 6 月残差。

她拿到真实 7 月后,会把它与更早训练期一起用于更新,再预测 8 月。这样不会暗示用六个点重估含多协变量的模型。若把 7 月月底才发布的岗位数带回 6 月,就能得到漂亮的事后拟合,却不能帮助当时安排服务。

预测区间同样需要被记录。一步预测可以使用最近余波;两步以后,旧冲击会衰减而新冲击、未来岗位和政策变化更重要。点预测看似清楚,区间才告诉项目组需要为多大的误差留出余地。

预测方案可用信息余波如何进入要比较的结果
基准回归月末已知协变量不单独利用残差记忆一步误差与区间覆盖
业务滞后已完成服务与已知批次用可解释的延迟路径是否优于同期变量
AR 误差最近残差与已知协变量按估计的 ρ\rhoρ 逐步衰减一步、两步的增益是否持续
高、低岗位情景计划岗位的不同兑现路径余波与输入风险共同呈现资源容量是否足够
重新训练触发口径变化、政策断点或连续失准不把旧参数硬套到新环境是否需要分段、补变量或缩短训练窗口

从六月预测七月、加入真实值后预测八月的滚动预测时间轴,区分事前可得和事后才知信息


南桥案例任务

现在请你接手林澈的月度跟踪表。已知 1—3 月残差连续为负,滞后 1 和滞后 2 的自相关(ACF)均为正,四月开始改变了记录方式,辅导通常在上月实施、当月逐步见效。项目组既需要预测下月就业率 yt+1y_{t+1}yt+1​,也要明确描述辅导 ct−1c_{t-1}ct−1​ 与就业的关联区间。

请按“发现—修正—边界”三步展开分析:

  1. 发现(Diagnosis):
  • 1—3 月月度残差均为负,表示实际值持续低于模型基准预测,即 et=yt−y^t<0,t=1,2,3e_t = y_t - \hat{y}_t < 0, \quad t = 1,2,3et​=yt​−y^​t​<0,t=1,2,3
  • 滞后 1 与 2 的自相关函数 ACF(et−1),ACF(et−2)>0ACF(e_{t-1}), ACF(e_{t-2}) > 0ACF(et−1​),ACF(et−2​)>0,提示短期残差有延续性,独立误差假设不符。
  • 四月记录方式切换,可能导致模型参数或解释变量 ctc_tct​、vtv_tvt​ 的跳变,不能简单延用此前相关。
  1. 修正(Correction):
  • 检查四月断点效应,对应模型新增断点虚拟变量 DtD_tDt​,可设 yt=β0+θ0ct+θ1ct−1+θ2ct−2+δvt+γDt+ety_t = \beta_0 + \theta_0 c_t + \theta_1 c_{t-1} + \theta_2 c_{t-2} + \delta v_t + \gamma D_t + e_tyt​=β0​+θ0​ct​+θ1​ct−1​+θ2​ct−2​+δvt​+γDt​+et​ 其中 Dt=1D_t = 1Dt​=1 表示四月及以后观测。
  • 采用 ct−1c_{t-1}ct−1​ 作为主业务滞后,因辅导多在上月实施,当前月见效。可以对比单期和两期滞后。
  • 残差序列可设为一阶自回归 et=ρet−1+ute_t = \rho e_{t-1} + u_tet​=ρet−1​+ut​ 若 ρ\rhoρ 明显大于 0,则AR误差模型更恰当;也建议用 Newey-West/HAC 标准误以稳健检验显著性。
  • 区别对照以下规格为参考:
    • 仅基准回归(无滞后,无断点,无AR)
    • 加入四月断点与业务滞后
    • 引入 AR 误差结构
  1. 边界(Boundary):
  • 目前训练样本较短,年周期性和季节影响尚无法分辨。
  • 四月以来观测量有限,ct−1c_{t-1}ct−1​、断点、AR 三者参数估算稳定性需谨慎。
  • 现实中的因果识别(如潜变量、未观测冲击)尚不足,只能说“关联增强”,不能直接判断“因果影响”。
  • 未来岗位与辅导的实际兑现值未必等于已知计划;即使有计划,未来输入仍有不确定性,区间预测需反映此类不确定性。

请务必在分析和报告中:

  • 写清每次预测的原点、各输入(ct−1c_{t-1}ct−1​、vtv_tvt​等)在什么时候可得;
  • 保留残差与结构变化的图表、短滞后正相关的统计,举出两种以上业务可能解释(如岗位减少、记录口径变化等);
  • 明确并列基准、业务滞后与AR误差三种模型规格并展示关键结果;
  • 报告常规与稳健(HAC/AR)置信区间,不只挑显著性最强一列;
  • 保存滚动预测的点值、置信区间、实际观测及重要事件的备注;
  • 最后将结论严格区分为“有关联”“有提升”“有限制”,避免直接断言因果。

这样有助于逐步完善模型,确保发现和解释都清晰、稳健、可复核。


把结论说轻

项目简报可以这样开始:“最近三个月实际就业率连续低于基准预测;残差存在短期延续迹象,因此独立误差下的区间可能过窄。”这句话既说明了发现,也没有把一个残差图夸大成对项目成败的裁决。

接着补上行动:“我们将核对招聘与记录变化,比较相关稳健区间和低阶动态规格,并在滚动预测中检查是否改善。”行动既可能是补变量,也可能是保留简单模型;复杂度不是进步,能被下一月检验才是。

最后写清边界:“辅导的正向关联仍需结合样本短度、年周期候选、未来输入和因果识别设计解释。”时间记住昨天并不可怕;可怕的是把昨天留在残差里,却假装它从未发生。

上一章有限因变量下一章非平稳数据