自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

计量经济学

  1. 01计量经济学导论
  2. 02线性回归模型
  3. 03最小二乘法
  4. 04假设检验与模型选择
  5. 05函数形式与结构变化
  6. 06广义回归模型与异方差性
  7. 07方程系统
  8. 08面板数据模型
  9. 09估计框架
  10. 10广义矩估计
  11. 11极大似然估计
  12. 12离散选择和事件计数
  13. 13有限因变量
  14. 14序列相关性
  15. 15非平稳数据
正在加载课程章节内容
课程经济学计量经济学极大似然估计

极大似然估计

南桥市自 2021 年实施“青年技能跃迁计划”以来,林澈整理了一份仅供课堂使用的模拟记录。她没有急着断言计划有效,而是先把问题收窄:哪组参数最能支持这些报名、完成培训与稳定就业记录?极大似然估计把这个问题写成一条可审计路线:规定数据怎样产生,再在这些规则内寻找峰顶。

她提醒同学,似然给的是模型内的证据排序,不是参数的主观概率,也不是政策因果效应的自动证明。全章人数、比例、收入与表格都是教学模拟;每次改动分母、随访日期或结果定义,都要视作一个新的分析版本。

林澈先冻结了六个月随访窗口、稳定工作的合同或社保口径、培训完成的截止日和收入的适用人群。她不把稳定就业者的收入空格填成零,也不把窗口后的信息倒灌到窗口前。这样,后面的每一项似然贡献才在回答同一个问题。

她还把“描述当前记录”“预测新记录”和“估计政策效果”写成三件事。极大似然可以参与三类计算,却不会替研究者跨过它们之间的逻辑鸿沟;同一份系数表也可能分别服务条件描述和预测,而不构成因果结论。


从支持度开始

林澈先拿 80 名已完成培训的青年做最小练习:统一窗口内有 52 人达到稳定工作口径。她在白板上写下 45%、65% 与 80% 三种候选机会,并请同学只看这 52 个成功和 28 个未成功,判断哪一个参数最贴合当前记录。

45% 把成功数看得偏少,80% 又把未达到口径的人数看得偏少,65% 与这批记录最相称。这里的“相称”是固定数据后参数的相对支持度;它不说 65% 是真值,也不说换一批按同规则追踪的青年后峰顶不会移动。

林澈故意让模型只含一个共同机会。这样能看清“数据支持参数”的方向,却遮住片区、基础准备与劳动力市场时点的不同。她提示:已完成培训者中的比例,不能直接借来代表所有符合资格青年,因为分母与选择过程已经改变。

南桥市青年技能跃迁计划教学模拟中,80 人有 52 人稳定就业;0.45、0.65 和 0.80 三种就业率参数中,0.65 最贴合记录。

林澈把同一表达式换一个阅读方向。固定 p=0.65p=0.65p=0.65 时,P(Y=1∣p)=0.65P(Y=1\mid p)=0.65P(Y=1∣p)=0.65 是“会观察到稳定就业吗”的概率,所有可能的 YYY 必须合计为一;固定 Y=1Y=1Y=1 时,L(p∣Y=1)=pL(p\mid Y=1)=pL(p∣Y=1)=p 则比较不同 ppp 对这个既成结果的支持度。

把 80 人结果固定后,L(p)=p52(1−p)28L(p)=p^{52}(1-p)^{28}L(p)=p52(1−p)28。数据在变时谈概率,参数在变而数据固定时谈似然;连续收入通常改谈密度,但阅读方向相同。林澈不允许把似然、预测概率和政策判断挤进同一句结论。

她又让大家看很小的似然值:绝对大小没有单独的直觉单位,乘上与参数无关的常数也会变。可比较的是同一记录下的排序、对数似然或与峰顶的差距;若多个候选支持度接近,诚实结论应是估计不精确。


把记录写成模型

接着,林澈把一张张青年记录排成数据表。她先问每一行究竟代表谁、在哪个日期被观察、结果是否适用,而不是先点运行按钮。只有这些角色写清楚,似然才不是软件输出后的补充说明,而是对数据生成规则的明确承诺。

在她的记号中,YiY_iYi​ 是窗口内稳定就业,TiT_iTi​ 是窗口前已编码的培训完成,XiX_iXi​ 是入项前特征。简单模型里,每条记录贡献 pYi(1−p)1−Yip^{Y_i}(1-p)^{1-Y_i}pYi​(1−p)1−Yi​,把各行贡献相乘便得到全样本似然。变量的日期、单位、允许取值和缺失代码也随版本保存。

林澈发现,同班青年、同一企业求职者或同一家庭成员的结果可能一起起伏。她不会把条件独立当成事实;若群组或时间结构明显,就需要把它写进模型。失访也不能自动算作未稳定就业,因为那会改变谁进入似然以及怎样贡献信息。

青年记录的入项特征、结业状态、稳定就业和收入关系图,收入卡片标明只在部分记录中观察到。

为了描述不同特征组合的条件机会,她令 ηi=β0+β1Ti+β2Xi2+⋯\eta_i=\beta_0+\beta_1T_i+\beta_2X_{i2}+\cdotsηi​=β0​+β1​Ti​+β2​Xi2​+⋯,再令 pi=exp⁡(ηi)/{1+exp⁡(ηi)}p_i=\exp(\eta_i)/\{1+\exp(\eta_i)\}pi​=exp(ηi​)/{1+exp(ηi​)}。林澈强调,β1\beta_1β1​ 只是在这些条件下的关联,不是培训让每个人增加同样机会,更不能直接称为因果效应。

她从最小模型向前走,并逐项确认结果与分母、入样规则、单条分布、参数边界和分析目标。逻辑函数只把预测限制在零到一之间,不能消除遗漏变量或非线性;把窗口后变量放进 XiX_iXi​ 还会改变条件对象,遮住本来要讨论的路径。


寻找参数峰

林澈把 80 条记录交给软件前,先请同学预测会遇到什么:许多小概率连乘会迅速下溢,而最受支持的参数不应因此改变。她于是把似然取对数,把每条记录的贡献从连乘改成求和,让“爬到最高处”的计算可见也可复查。

对数单调递增,所以不会改变谁最受支持:ℓ(θ)=∑ilog⁡f(yi∣θ)\ell(\theta)=\sum_i\log f(y_i\mid\theta)ℓ(θ)=∑i​logf(yi​∣θ)。在 52 个稳定就业、28 个未稳定就业的简单模型中,ℓ(p)=52log⁡p+28log⁡(1−p)\ell(p)=52\log p+28\log(1-p)ℓ(p)=52logp+28log(1−p),峰顶在 p^=52/80=0.65\hat p=52/80=0.65p^​=52/80=0.65。对数值为负不代表模型失败,可在同一数据和可比的似然定义下比较,但不同复杂度的模型还需考虑复杂度惩罚。

林澈展示三种候选时,要求学生只读相对高低。预测概率接近零却实际发生的记录,会强烈拉低目标函数;这可能是编码错误、罕见组合或遗漏结构的信号,不是自动删除这条记录的理由。

候选 ppp对数似然约值对当前记录的阅读
0.45-58.26稳定就业人数显得偏多
0.65-51.80三者中支持度最高
0.80-56.67未稳定就业人数显得偏多

到了有协变量的版本,林澈让软件最小化负对数似然,并保留起点、参数变换、目标值和警告。她检查参数是否停在有效边界内、不同起点会否到达同一目标、梯度是否够小,以及 Hessian 是否近乎奇异;“收敛”只是数值停止规则。

完全分离会使逻辑系数发散,高度相关会形成平坦山脊,局部峰会让起点改变答案。若几组参数同样好,她报告“数据无法清楚区分”,而不是从软件显示的小数位挑选一个获胜者。复杂模型的核心逻辑仍是每行一项贡献、总贡献相加、寻找最高点。

对这个比例模型,求导得到 52/p−28/(1−p)=052/p-28/(1-p)=052/p−28/(1−p)=0,因而得到样本比例 0.65。这个小推导提醒林澈,峰顶来自模型和样本共同决定,并非经验公式;有协变量时通常没有闭式解,仍要回看每条记录给目标函数带来的影响。

三个纸雕对数似然地形:最高点、平坦山脊和边界峰值;彩色路径表示不同初始值,旁注参数约束。


读取斜率曲率

林澈把峰顶画成一座山,邀请同学不要只盯住最高点。坡度说明下一步往哪里走,山形说明参数是否容易区分;一座尖峰和一条平坦山脊都可能给出同样的拟合值,却会带来很不一样的不确定性和数值风险。

她用得分 U(θ)=∂ℓ/∂θU(\theta)=\partial\ell/\partial\thetaU(θ)=∂ℓ/∂θ 表示最快上升方向,用 Hessian H(θ)=∂2ℓ/∂θ∂θTH(\theta)=\partial^2\ell/\partial\theta\partial\theta^\mathsf TH(θ)=∂2ℓ/∂θ∂θT 表示弯曲。逻辑模型中,U(β)=XT(y−p)U(\beta)=X^\mathsf T(y-p)U(β)=XT(y−p),H(β)=−XTWXH(\beta)=-X^\mathsf TWXH(β)=−XTWX;牛顿更新便用坡度和曲率修正下一步。

当某片区总比预测更易稳定就业,林澈不急着多加变量。她先回看结果口径、非线性、交互、群组依赖和数据质量;曲率接近零可能只是信息不足,不是发现了一个稳定的项目差异。把正标准差写成 exp⁡(a)\exp(a)exp(a) 也只是让搜索停在有效空间。

峰顶之外还要读峰形。观测信息 J(θ^)=−H(θ^)J(\hat\theta)=-H(\hat\theta)J(θ^)=−H(θ^) 越大,地形越尖,重复抽样下的摆动通常越小;常规大样本下,Var⁡^(θ^)≈J(θ^)−1\widehat{\operatorname{Var}}(\hat\theta)\approx J(\hat\theta)^{-1}Var(θ^)≈J(θ^)−1。这是一种近似,不是给每个数据集自动附上的保证书。

林澈特别标记稀有结果、参数边界、小样本、群组依赖、错设和不可识别。它们都会削弱正态近似;若优化器报无穷大、非数或迭代上限,应先查不可能值、稀少类别、共线和符号错误,而不是反复运行直到出现“成功”。

尖锐蓝色似然峰配窄区间表示较小不确定性,平坦珊瑚色似然峰配宽区间表示较大不确定性,并标出似然比区间。


检查模型

模型跑完后,林澈没有立刻把最高对数似然贴进报告。极大似然只会在指定模型族里找峰,峰顶不能反过来证明模型合适。她把诊断视为沿着记录、拟合和计算三条线追问:哪里出错、错在谁身上、修正后又改变了什么。

检查时,她按下面的动作留下可追溯记录:

  • 数据:核对随访起点、窗口前编码、单位、日期、重复和失访。
  • 拟合:二元结果读校准,连续收入读残差与尾部,并对高杠杆记录做敏感性分析。
  • 计算:保存多起点、目标值、梯度、边界与警告,不把收敛提示当成充分证据。
  • 解释:先定位系统错在何类记录,再判断是否需要非线性、交互或群组结构。

林澈发现某片区预测长期偏高时,会先回查市场机会的测量和追踪率,而不是直接堆高阶交互。成千条来自同一培训班的记录也不等于成千条独立信息;系统性缺失不会因样本行数增多而自行消失。

并排的三种似然警示:完全分离的两类记录、贴在参数边界的峰,以及两个旗点同高的不可识别山脊;提醒常规近似可能失效。

她把预测质量拆成区分和校准:前者看谁更可能稳定就业,后者看相似人群中报出的 0.70 是否约为七成。训练集表现好不等于可推广,留出期或交叉验证还要沿用同一结果定义和时间顺序,并按关键子群阅读校准图。

若名额有限,林澈可以按预测概率或透明业务规则排序,但这不是谁会从服务获益的证据。预期受益排序需要个体因果效应目标与研究设计;阈值也应同时考虑校准、容量、公平和错分代价,而不是默认 0.5。


拆开就业收入

讨论收入时,林澈把稳定就业和收入记录拆成两步。她拒绝把收入空格填成零:只有 Si=1S_i=1Si​=1 的稳定就业者才有“稳定岗位月收入” RiR_iRi​ 可观察。这样先说明谁进入稳定就业,再说明进入者的收入,才不会把不适用的结果伪装成低收入。

f(Si,Riobs∣Xi)=f(Si∣Xi){f(Ri∣Si=1,Xi)}Sif(S_i,R_i^{\mathrm{obs}}\mid X_i)=f(S_i\mid X_i)\{f(R_i\mid S_i=1,X_i)\}^{S_i}f(Si​,Riobs​∣Xi​)=f(Si​∣Xi​){f(Ri​∣Si​=1,Xi​)}Si​。

这个链式分解不等于就业与收入条件独立,也不等于已经纠正选择偏差。就业部分使用全部随访人的二元记录,收入部分只用稳定就业者;收入右偏时可以在对数尺度建模,但解释必须回到相应的收入尺度。

培训完成、稳定就业和可观察收入构成选择路径;蓝色虚线路径标为条件关联,红色虚线路径提示因果效应需要证据。

林澈若只描述稳定就业率和进入者收入形状,这个分解已经足够。若比较完成与未完成培训者的收入,她先问两组是否可比;未记录的动机、健康和招聘机会会同时影响就业与收入,不能把混合差异改写成培训收益。

她还把空格分成三类:结果不适用、稳定就业后失访、已问到但拒答或异常。后两类必须报告比例和处理方案;第一类不能用零替代。推断未稳定就业者进入岗位后的反事实收入,则需要更强的结构、识别条件与敏感性分析。


比较模型

林澈准备比较两个就业模型时,先把两份分析记录并排:是否同一批青年、同一结果、同一观察规则?只有完整模型是受限模型的嵌套扩展,且比较对象完全相同,最大对数似然才应不低于受限模型;比较之前的可比性检查比最后的统计量更重要。

此时可考察 2{ℓ完整−ℓ受限}2\{\ell_{\text{完整}}-\ell_{\text{受限}}\}2{ℓ完整​−ℓ受限​},并在常规大样本下用卡方近似。似然比大只说明受限假设不受当前数据支持,不能说明新增项具有因果作用。小样本、稀有结果、边界和大量探索都会削弱这一近似。

比较情形先确认什么可用的主要证据不能直接推出什么
嵌套的就业模型同一数据、同一结果、限制可明确写出对数似然差与似然比新增项具有因果作用
非嵌套候选模型相同目标与评估集信息准则、留出对数评分、校准参数更多一定更好
收入与就业模型观测样本和结果定义不同各自的诊断与任务表现两个总对数似然可直接比较
预测与政策模型预测目标或因果目标是否不同外部验证或研究设计拟合更好即可指导政策

对非嵌套候选,林澈不把参数数目或训练集对数似然排成总榜。信息准则权衡拟合与复杂度,留出数据检验离开训练记录后的表现;它们都是辅助证据。她写明候选集、数据切分、指标和选择理由,也展示未选中的合理模型。

模型选择始终服务任务:预测看留出期校准与覆盖范围,描述看可解释性和不确定性,因果则先问研究设计能否识别目标。极大似然可服务因果设计,却不能代替比较组、处理前信息和关于未测混杂的论证。

纸质流程图把问题定义、数据流程、似然设定、优化、不确定性、诊断和报告连成可审计闭环。


南桥任务

最后,林澈请同学把练习写成一份可审计说明,而不是只交一张系数表。说明应让后来接手的人看得出分母如何确定、哪些记录进入似然、哪种结论只是条件关联,以及为什么有些关于计划效果的问题仍不能回答。

交付时依次完成这些检查动作:

  • 写明分母、统一随访起点、六个月窗口和稳定工作口径。
  • 列出 YiY_iYi​、TiT_iTi​ 及窗口前测量的 XiX_iXi​。
  • 拟合截距模型与预先指定特征模型,记录对数似然、起点、收敛与校准。
  • 比较前确认嵌套与同一记录;收入部分单列 Si=1S_i=1Si​=1 的观察规则。
  • 报告代表性组合的模型内预测与一项敏感性分析,避免把外推写成稳健结论。

林澈要求报告同时给出预测概率、区间或不确定性、诊断与至少一项敏感性分析。读者应能分辨哪些结论用于描述,哪些用于预测,哪些因缺少比较组、处理前信息或设计支撑而不能称为计划效应。

提交前,她让大家再问三件事:换一批记录估计会怎样变,谁没有被完整观察,哪些假设能诊断而哪些只能靠设计辩护。若这些问题仍答不清,就应先补数据定义、比较组或记录流程,再让软件寻找下一个峰顶。

上一章广义矩估计下一章离散选择和事件计数