一项经济理论是不是“有道理”,不能只看它听起来多么顺畅。更重要的问题是:如果它错了,我们准备在什么地方、用什么观察把它找出来?这个问题会把抽象的模型拉回到可检查的现实,也会让政策讨论从“我相信”走向“我们怎样知道”。
例如,远川市准备为登记求职者发放六个月的交通券,使用者乘坐公交和地铁时可享受较大折扣。政策团队的直觉很自然:求职交通更便宜,人们能去更远的地方参加面试,正式就业率就会提高。于是有人把这句话概括为:降低求职者的出行成本,会提高他们的就业机会。
这是一句值得认真对待的经济主张,却还不是一个可检验的结论。它把“成本下降”“搜索范围扩大”“面试增加”“就业提高”连成了一条链;链条中任何一环断裂,最后的政策效果都可能没有出现。学习可检验性,就是学习如何不急着为这条链喝彩,而是先替它设计一个可能失败的机会。

先作一个区分:经济理论不是对每个个体、每一天都会发生什么的逐字预言。它通常抽取若干机制,说明在一组条件下,变量之间为什么可能以某种方向关联。模型的简化不是原罪;没有简化,我们无法辨认机制。真正的风险是把简化当成现实本身,或把一个从未规定失败条件的说法当成理论。
远川市团队最初写下的判断是:“交通券有助于就业。”这句话几乎不会遭遇反驳:如果就业上升,可以归功于交通券;如果就业没有上升,又可以说券额不够、观察期太短、求职者不够积极。无论发生什么都能解释,恰恰意味着它没有清楚地承担风险。
把它改写后,问题就变得不同:在政策开始后三个月内,对符合条件且确实处于求职状态的人,获得交通券应当提高有效面试次数,并提高进入正式岗位的比例;若其他条件相近而这些指标没有系统性提高,这一“交通券单独能够改善就业”的主张便受到挑战。
这段话做了四件事:限定对象、说明处理、规定结果、留下可能落空的空间。最后一点最关键。可检验不是保证理论会被推翻,而是承认世界可以给出不利于它的回答。
这里的“可能不支持”不是故意唱反调,而是给主张画边界。若我们无法写出哪种结果会令自己犹豫,就还没有把理论同数据真正接上。反过来,写得越具体,理论承担的风险越大,研究也越有信息量。
还要分清两个容易混淆的层次。一个是逻辑命题,例如“出行成本下降会放宽预算约束”;另一个是经验命题,例如“本市这类交通券会在三个月内使就业率上升”。前者说明机制可能如何运转,后者则把机制放进特定人群、制度和时间中接受检验。经济学的价值常来自两者往返:没有机制,数据只是许多一起变化的数字;没有经验检验,机制就可能停留在漂亮的故事。
好的检验不从“我手里有哪些数据”开始,而从“如果这套解释成立,还应该看见什么”开始。远川市的主张并不只预测最后的就业率,它还隐含了可被观察的中间结果。交通券若真通过降低搜索成本发挥作用,获得交通券的人应更常使用公共交通去求职,面试的地理范围应扩大,先有面试机会变化,之后才可能出现就业变化。
这会把一个笼统结论拆成一组彼此关联的预测。拆分的好处是,哪怕最终就业没有提高,我们仍能看见理论在哪一环遇到了问题:是券没有被使用,还是出行增加却没有转化为面试,抑或面试增加却没有带来录用?不同答案对应不同的理论修正和政策动作。
若要把预测作为对理论的严格检验,它应在查看主要结果之前写下。研究者当然可以在探索性分析中寻找新的线索;问题在于,若先浏览大量指标、之后只挑出恰好显著的几个,再把它们说成原先的预测,检验就会变成“事后配故事”。预先说明主要结果、观察窗口、样本规则和分析办法,不能消除不确定性,却能让读者知道研究没有临时移动终点线。

有些学习者会问:既然现实如此复杂,是否任何结果都能找到别的解释?答案是可以找到替代解释,但不能因此放弃检验。研究的任务正是让不同解释作出不同预测,并设法让数据区分它们。比如,若结果来自“同期岗位大增”而不是交通券,那么没有获券却处于同一劳动力市场的人也应出现类似改善;若真来自交通成本,原先离岗位较远且交通负担较重的人应该更敏感。理论的力量不在于免受质疑,而在于能组织出有分辨力的质疑。
经济模型常借助“其他条件不变”。这不是一句让反例失效的口令,而是一份必须说明的工作清单。远川市的主张至少依赖以下前提:符合条件的人知道政策并能顺利领券;公共交通能到达潜在岗位;岗位确实存在;用工方不会因政策改变录用标准;其他大型就业措施没有只覆盖同一批人;所称“正式就业”被稳定、准确地记录。
这些前提并非都要完全真实。模型可以在近似条件下仍然有用。关键在于研究者要说明:哪些偏离影响很小,哪些偏离会改变结论。例如,少数人忘记领券或许只会削弱平均效果;但如果交通券只能在市中心使用,而新增岗位大多在郊区,那么“出行成本下降”的核心处理就没有真正发生。
可把理论的适用范围理解为一张使用说明书:它告诉我们何时应期待机制发挥作用,也告诉我们何时不应把失败的预测解释成例外。边界写得清楚,理论反而更有用,因为它能指导场景判断,而不是承诺放之四海皆准。
一个模型的假设可以是理想化的;但由这些假设推出的经验含义,必须能与现实记录发生碰撞。假设的真实程度、预测的准确程度和因果识别的可信程度,是相关却不同的三件事。
这也解释了为什么不能只问“假设真实吗”。“所有人都完全理性”很难逐人逐时成立,却可能在某些市场中提供有用的近似;相反,一个看似贴近生活的叙述,如果从不导出可比较的结果,也未必更有解释力。判断模型要看它对什么问题、在什么范围内、以多大误差作出什么预测,而不是只在“真实”与“虚假”之间二选一。
三个月后,远川市看到获券者的正式就业率高于政策开始前。能否宣布成功?还不能。毕业季、经济景气、招聘会、求职者自然恢复信心,都会使就业率改变。一个“前后对比”只能描述变化,不能单独说明变化由谁造成。
要检验交通券的因果主张,需要构造一个尽可能可信的反事实:如果同一类人没有拿到券,他们会怎样?现实中一个人不可能同时处于“拿到”和“没拿到”两种状态,因此研究只能寻找在政策以外足够相似的比较对象。
最清晰的安排,是当名额有限而资格相同的申请者通过公开抽签分批获得交通券。抽签前,两组都有机会相近;抽签后比较结果的差异,便更接近交通券造成的差异。不能抽签时,也可能利用分阶段推行、资格阈值或地区间时点差异,但每种设计都有额外条件,必须明确检查,而不能只给它贴上“自然实验”的标签。

比较组不是一项统计装饰。它决定了“就业提高”究竟是政策效应,还是我们本来就会看到的变化。回归、显著性检验和复杂算法能帮助整理不确定性,却不能自动修复糟糕的比较。若两组在政策前已经以不同速度改善,或者政策同时向获券组提供了密集岗位推荐,系数再精致,也回答不了交通券单独的作用。
这也提醒我们把“没有统计显著差异”与“没有实际效果”分开。样本太小、结果记录不完整或观察时间太短时,研究可能没有足够能力区分一个小效应和零效应。相反,一个数值上很稳定的差异,也可能小到不足以改变政策取舍。报告不确定性和实际量级,是诚实检验的一部分。
远川市按抽签分配后得到一组令人不舒服的结果:交通券被频繁激活,跨区乘车也增加了;但与未获券的可比人群相比,有效面试次数没有明显增加,三个月内的正式就业比例也没有清晰差异。团队此时最容易犯两种相反的错误:要么宣布“经济理论毫无用处”,要么立刻说“数据肯定有问题”。
更好的做法是把异常变成诊断。先确认结果有没有被错误制造出来:抽签是否真的执行?两组是否都被跟访?面试和就业的定义是否一致?使用者是否把券用于求职出行?再检查辅助前提:岗位信息是否可得,面试时段是否与公交班次匹配,企业是否要求线上预筛选,照料责任是否让一部分人无法远行。最后才判断:核心机制是否需要修改,还是适用范围应缩小。
因此,证伪不能被理解成“出现一个不合意数字,就把整套理论扔掉”。从逻辑上说,一个与强预测冲突的可靠观察会给主张带来严重压力;从实际研究看,观察还连着测量规则、数据质量、模型设定与背景条件。严谨不是替理论找借口,而是公开这些连接点,规定哪些核查完成后我们才接受挑战,并让其他人能够复查。
如果重复检验仍显示“券提高了出行,却没有提高面试或就业”,团队可以把原先的强主张收缩为:交通补贴可能缓解出行约束,而其就业效果可能取决于岗位信息、面试安排或中介服务;这仍是有待新数据检验的修正假说。这个新版本更窄,却产生了新的风险性预测:在提供岗位匹配服务的地区,交通券的效果应高于只发券的地区。理论不是靠加上一句万能的“视情况而定”逃离反驳,而是靠提出新的、同样可以失败的预测前进。

可检验性常与“证伪”联系在一起,但它并不要求研究者以推翻理论为唯一目标。经验上,许多经济命题是概率性的、条件性的:它们说的是平均倾向,而不是每一个人必然如何。对此,检验的形式通常是比较估计结果与理论预测是否相容,考察结果在不同样本、不同测量和合理替代设定下是否稳健,而不是寻找一个个体反例就宣布终局。
同样,理论在多次检验中表现良好,也不等于被最终证明为真。它只是在已经经历的、定义清楚的困难测试中暂时站得住。下一次更长的跟踪期、另一座城市、不同的劳动力市场制度,都可能显示它的边界。把“支持”理解为暂时的、条件化的证据,可以避免把模型当成信条。
远川市最后不必在“继续发券”与“立即取消”之间赌一次成败。可以将理论修正为以下两个可分开的干预措施:
在开始前,还需明确:
这样,政策实施本身就成为学习机制。需要注意的是,这样的两组设计可以识别“在已有交通券的基础上增加匹配服务”的效果,不能单独识别交通券本身的效果,或两项措施的交互作用。
理论修正也应遵循节制原则。每遇到反例就堆叠一个新变量,会使模型越来越能解释过去、却越来越难预测未来。一个实用准则是:新增机制必须有独立的行为含义和可观测指标,必须说明它在什么条件下起作用,还必须带来至少一项此前没有提出过的预测。这样,复杂化才是在增加解释力,而不是增加逃生门。
当你阅读或撰写一项经济研究时,可以沿着下面的流程追问。它不要求每个课题都做随机试验,也不保证一次研究给出终极答案;它要求研究者把推理链暴露出来,使别人能看见哪里强、哪里弱、下一步怎样改进。

为了练习,可以回到本章开头的城市。请判断下列说法中,哪一句最接近可检验的经济命题,并说明另一句缺了什么。
B 更接近可检验命题,因为它规定了对象、场景、时间、指标、比较基准和可能受挑战的结果。它仍然可能做错:面试次数未必等于就业质量,三个月也可能太短。但这些局限是可以补充、讨论和再次检验的,而不是藏在一句无法失败的承诺里。
经济理论的可检验性,归根结底是一种对现实保持开放的纪律。它要求我们把机制说清,把预测说得足够具体,把可能的反证提前摆在桌面上;也要求我们在数据不合意时,不用修辞掩盖问题,而是检查设计、承认边界、提出更好的下一轮问题。
远川市交通券案例的收获并不只是一项政策是否有效。它展示了经济推理如何变得可学习:从一个直觉出发,推导可观察的后果,和可信的比较对象相遇,在异常处辨认理论的边界,再用新的预测换取下一次检验。能够经历这种循环的理论,未必永远正确,却比永远不会输的说法更接近科学,也更值得进入真实决策。