一笔钱只能花一次时,评价就很难只是“算一算”。设想松岭市北河片区的供暖系统老化:冬天有些住户室温偏低,能源浪费也很严重,老锅炉还带来污染。市政府拿出 3.6 亿元转型预算,却不足以在同一时期完成所有工作。
方案甲是先整体更新主管网和热源。它覆盖约 12 万居民,预计三年后全片区能耗明显下降;但最冷、最无力自行维修的住户还要再等。方案乙是先为 1.2 万低收入、老年和残障住户做保温、检修与账单支持。它能较快缓解最急迫的困难,却因为逐户施工、规模较小,单位改善成本更高,其他居民的等待期更长。还有人主张加入方案丙:安装智能计量设备并按家庭情况发放差异化补贴,以减少浪费;反对者则担心,租住者、没有稳定数字设备的人,或不愿交出详尽家庭信息的人,可能被排除在外。
假如你坐在评审桌前,你会先问哪一个问题?是“总共能少花多少能源费”,还是“今晚谁仍然挨冻”,抑或“政府能否为了更精确的补贴要求人们提交多少信息”?三种问法都关心公共利益,却指向不同的“更好”。这正是经济政策评价的哲学起点:在测量之前,先辨认我们在赞成什么、不能接受什么,以及由谁承担代价。
北河片区的材料可以越做越精细:工程造价、每户能耗、就医记录、满意度、碳排放、就业变化,都可能进入表格。但材料本身不会告诉我们该优先改哪一栋楼。数据回答的是“可能发生什么”;评价还必须回答“发生什么才算改进”。后一个问题包含价值判断,不能由一个看似客观的总分悄悄代替。
可以把政策评价看成两条线同时推进:

把这两条线分开,并不是要让价值脱离证据。恰恰相反,价值主张越明确,越知道该收集什么证据。若主张优先保护最困难住户,就不能只报全片区平均室温,而要观察最低收入、租住、独居老人等群体的实际改善;若主张避免数字排除,就要记录申请失败、人工申诉和数据错误的情况。好的评价让价值接受事实检验,也让事实的解释回到公开的价值讨论。
北河案例还有一个容易忽略的维度:时间。主管网改造的收益可能持续多年,施工扰动却先发生;账单补助立刻减轻负担,但未必解决住房保温差这一根源。今天的住户、未来的纳税人、转岗中的锅炉工和尚未搬入的租户,都在政策后果之中。评价若只截取某一年,往往会把“快”误写成“好”,或把远期承诺误写成已经兑现的福利。
先把“有效”与“值得”区分开,会使讨论更清楚。假设严谨的比较发现,方案甲每投入一百万元带来的总节能最多。这支持它在节能成本效果上的优势,而非所有福利维度的效率优势,却还没有推出“应当选择甲”。若甲的主要收益流向本来就温暖、支付能力也较强的楼栋,而极端寒冷集中在少数老旧租赁房,那么“最大总节能”与“最可接受的分配”是两个判断。
同样,方案乙的支持者不能只说“它更有温度”。需要说明困难家庭如何识别、房东是否会借改造抬租、补贴是否真的到达居民、等待中的其他住户如何被对待。价值立场不是免于核查的口号;它决定优先级,也承担说明责任。
表格不是让我们为每一格套上固定权重,而是防止遗漏。尤其要防止把“可量化”误当成“更重要”。室温、支出和排放容易计数,尊严、控制感、邻里互助、免于被不合理监测的自由较难折算为金额;难折算不等于可以忽略。相反,评价者应明确哪些影响可以货币化,哪些只能以单独的阈值、叙述证据或程序审查来呈现。
这也解释了为什么同一份研究可能引出合理而不同的结论。争论未必来自谁“不尊重科学”,而可能来自:有人把资源总量的增加放在首位,有人认为起点处境越差越应优先,有人坚持某些权利不可拿来交易。把分歧说清楚,比假装存在唯一的技术答案更有利于协作。

政策分析常从激励出发:补贴会不会改变用能行为,价格会不会减少浪费,施工补偿会不会影响配合程度。这种推理很有用,因为人们确实会对成本、时间和信息作出反应。但若把居民只写成“追求个人利益且信息充分的计算者”,评价就容易失焦。
在北河案例中,一位租户可能知道申请节能补贴有利,却担心房东据此涨租;一位独居老人可能愿意报修,却不会使用线上入口;锅炉工人抵触关闭岗位,并不一定是反对减排,也可能是担心家庭收入和职业尊严。这里的行为包含有限信息、时间压力、信任、习惯、照料责任和制度约束。把这些都归为“不理性”,不能帮助改进政策。
较好的做法是把行为假设当作可检验的工作假设,而不是道德判断。评价可以追问:居民是否看得懂账单?人工渠道是否与线上渠道同样有效?补贴规则是否制造了“多赚一点反而失去资格”的断崖?工人获得培训后是否有真实的岗位衔接?这些问题把“为什么没有按预期行动”转化为可改善的设计问题。

自利也不等于自私。具体来说:
如果评价只依赖金钱激励,可能破坏原有的互助和信任关系;而如果完全忽略个人利益和现实执行压力,制定出的要求又可能难以落实。
因此,关键不是在“自利”与“利他”之间二选一,而是要识别:
哪种动机会变得更加重要。
这还涉及责任归属。低收入家庭能源支出高,可能源于收入低、房屋保温差、租赁市场议价弱、家庭成员健康状况等多重原因。若评价把困难完全归因于个人选择,就会把结构性障碍从视野中删去;若完全否认个人选择,也可能忽略服务是否真正可用。对人的理解越完整,政策越不容易把需要帮助的人误判为“不配合者”。
说一项政策“提高福利”,至少有三种不同意思。它可以指人们偏好得到满足,例如取暖更舒适、支出更低;可以指每个人拥有过得去的基本条件,例如安全住房、稳定热源和可达的申诉渠道;也可以指较差处境者的改善得到额外重视。它们会重叠,却不会总是给出同一个排序。
方案甲若使大多数住户账单略降,平均福利可能提高。可是,如果最冷的楼栋仍在等待,方案乙的支持者会认为,先使生活跌破基本线的人回到可接受状态更紧迫。还有人会主张机会公平:不只发放短期补贴,还要修复住房、提供转岗培训和可负担的公共服务,使人有能力在未来做选择。这里关心的不是某次支付后的余额,而是人能否实际拥有体面生活的条件。

公平也不是“每人一样”这么简单。相同金额的补贴,对高收入自有住房者和寒冷租赁房中的老人,意义可能完全不同;同样的施工安排,对白天在家的居民和夜班工人,打扰程度也不同。公平的判断可能着眼于结果是否缩小不合理差距,也可能着眼于机会是否平等、规则是否一致、特殊需要是否得到合理照顾。评价应说明自己采用哪一种判断,并检验它是否与问题相称。
例如,可将北河的最低要求事先写明:任何住户都不应因改造而失去基本供暖;人工申请和无障碍服务必须可用;因公共改造产生的合理损失要有透明补偿;重点楼栋的识别必须允许更正。它们不是效率指标的附属说明,而是对“可接受方案”的边界。满足边界后,才适合比较不同方案能带来多少额外改善。
在实践中,分组统计十分重要,却也要谨慎。按收入、年龄、残障、居住方式或地区拆分结果,有助于发现平均数掩盖的问题;但标签不能替代个体,也不能造成污名。公开统计应避免暴露不必要的个人信息,群体差异的解释也要回到住房条件、服务可及性和制度环境,而不是把问题本质化为某一群体“能力不足”。
效率关心的是:在有限资源下,能否以较少投入获得较多有价值的结果。它提醒我们不能因为目标善良,就不问项目是否浪费、是否有更便宜有效的替代方案。对北河而言,比较主管网更新、逐户保温、账单支持、培训和维护,不只是看预算总额,还要看寿命周期的维修费、施工扰动、污染、健康变化、岗位转移以及未改造时本会发生什么。
成本—效益分析的作用包括:
需要注意的是,把影响写成金额,并不代表价值争议已消失,原因包括:

还有一种常见的效率语言是“没人变差而有人变好”。这当然是有吸引力的改进标准,但公共政策很少如此轻松:税收要筹集,施工会扰民,旧岗位会调整,预算投向一处就不能投向另一处。于是有人会说,只要总收益足以补偿受损者,方案就可以接受。问题随之而来:补偿是不是确实发生,拿到补偿的人是否能弥补失去的东西,谁有资格判定补偿足够?
北河若选择方案甲,不能只在模型中假设“节能收益足以补偿等待者和转岗工人”。评价应核查补偿是否有预算、何时到账、申领门槛如何设置、房租变化会否吞掉收益,以及在过渡冬季谁承担风险。补偿若只存在于计算表中,就不能把它当成已实现的公平。
一个更稳健的比较顺序可以是:
经济政策评价的哲学基础,不是一组用来替代数据的漂亮词汇,而是一套让数据、理由与责任彼此对照的习惯。评价者需要知道自己在衡量什么,也需要承认没有衡量到什么;需要比较效率,也需要问收益和风险落在谁身上;需要尊重个人选择,也需要看见选择被哪些条件限制;需要追求眼前的效果,也需要给未来留出安全和选择。
回到北河片区,真正困难的不是找到一个万能指标,而是把“更好”的多种含义说得足够具体,以便公众检验、不同群体回应、实施者执行。任何最终排序都应留下开放问题:若预算增加或预测落空,优先级是否改变?若一项权利与大规模收益冲突,哪些边界不能退让?若弱势群体的改善难以量化,怎样让其经验进入决定?这些问题没有脱离现实的标准答案。愿意公开它们,正是负责任的政策评价开始的地方。