想象你刚走进一间临时实验室。你和另外三位匿名同学各有 20 枚实验币,桌上有一个“校园雨水花园”账户。你可以把 0 到 20 枚中的任意数量投入账户;每投入 1 枚,这一枚投入会被放大为 1.6 枚,再由四个人平分。你知道:别人看不见你的选择,也不能拒绝拿走账户里的收益。
你会投多少?先别急着替别人回答。若其余三人合计投了 36 枚,而你投了 0 枚,你可以带走 20 + 0.4 × 36 = 34.4 枚;若你也投 12 枚,四人的投入合计是 48 枚,你带走 8 + 0.4 × 48 = 27.2 枚。单从这一轮自己的钱看,少投似乎更划算。可当四个人都这样想,账户里一枚也没有,大家都只剩 20 枚。第一个意外就在这里:对每个人都显得有利的选择,会让小组错过共同能得到的更高收益。
在一次课堂试做中,第一轮四人分别投入 12、10、8、6 枚,远高于“全都不投”的推演结果;到了后面几轮,有人发现自己一直投得更多,投入开始下降。这个小故事不是为了给谁贴上“自私”或“高尚”的标签,而是本章贯穿的实验场景:同一群普通人,面对不同规则时,会怎样合作、猜测、学习和改变?

经济学实验室的价值,不在于复制一整个校园或城市,而在于把问题收缩到可辨认的结构:初始资源是什么,参与者能知道什么,规则允许做什么,报酬怎样随选择变化。研究者刻意保持大部分条件不变,只改变一个关键环节,便能比较结果差异是否可能由该环节造成。它既可以检验理论预测,也可以暴露理论遗漏的因素,还能在真实制度大规模实施前帮助人们发现脆弱处。
但实验并不是一台“读心机”。一次投入记录能显示在这套规则下出现了什么,却不能直接证明某个人的品格、一个群体的永久偏好,或一项政策在所有地方都会产生同样效果。实验能把因果问题问得更清楚;能否把答案带回现实,仍要看参与者、任务、信息、风险与现实场景到底相差多远。
“雨水花园”不是对某一个真实项目的复刻,而是公共品困境的简化模型。它保留了关键关系:投入会让所有成员受益,获益者却无法被排除;一个人的投入也不会减少别人获得同样好处的机会。现实中的防洪设施、社区环境、共享知识和一些公共服务,都可能包含这类外溢收益,但它们还叠加了法律、身份、预算、长期关系和许多难以一次放进实验室的条件。
先把规则写成每个人都能核算的形式。设第 位参与者投入 ,四人的总投入为 。每人本轮收益为:
其中 0.4 来自 。在其他三人的选择固定时,我自己每多投 1 枚,个人收益减少 1 枚,却只拿回 0.4 枚;所以若只关心当轮自己的实验币,0 枚是最优反应。与此同时,小组总收益为 ,每多投入 1 枚,小组总收益增加 0.6 枚。因此,四人全部投入会使小组收益最大。这里没有矛盾:个人激励和小组效率指向了不同的选择。

为了让“规则”而非口才或算术能力主导结果,实验说明必须把以下内容讲清楚:每个人的初始额度、账户的放大比例、匿名程度、轮数、是否固定同组、最终报酬如何换算,以及是否存在额外选项。参与者要有时间阅读、提问并完成理解题;若有人没弄懂乘数、分组或报酬,研究者不能把其后续选择简单当成偏好表达。
实验中的报酬并非装饰品。把后果与选择相连,是为了让“我为什么选这个”成为有实际权衡的决定,而不仅仅是随手勾选看似正确的答案。
具体来说,报酬设计时需要注意:
这些措施都有助于确保实验结果能够真实反映参与者在该环境下的实际权衡与选择。
如果这一轮四个人都投了 0 枚,不能立刻得出“人类只在乎自己”;如果四个人都投了 20 枚,也不能立刻宣布“大家天生合作”。一个观察值最多告诉我们:在这一次说明、这组参与者、这套报酬和这段时间里,发生了这个结果。实验推断从来不是把一个结果变成一个故事,而是把故事拆成可比较的预测。
对于雨水花园,至少有三种可检验的解释:
具体来说:
好的实验设计会在开始前写清楚主要问题、比较对象和判断标准,而不是等看到数据后才挑选最顺眼的解释。
重复进行时,历史会进入决策。若每轮结束后只公布小组总投入,参与者看见的是共同后果;若再公布每个人的匿名投入,大家能比较自己和他人;若始终不反馈,他们只能靠先验猜测行动。许多有限轮次的公共品实验中,平均投入常会随重复而下降,但下降幅度、速度与原因并不固定:可能是失望后的回应,可能是学习了激励,也可能是最后一轮临近时策略改变。把这些可能性区分开,远比用一句“合作失败”更有研究价值。

下面是一份用于课堂讨论的虚拟记录。它不是研究结论,而是练习从同一组数字中提出不同问题。
这张表让我们看见“行为路径”,却看不见参与者当时真正的理由。若只凭路径判定甲“最有公共精神”、丁“最自私”,就把经济学实验误用成了人格测验。更稳妥的做法是把可观察选择、事先设置的条件和参与者事后的解释分开记录,再问它们彼此是否一致。
实验最强的地方,是让规则改变得足够明确,以便比较。假设班级招募足够多的参与者,随机把每四人一组分配到不同条件中;除了下面写明的内容外,初始额度、倍数、轮数、说明文字和支付方式都保持一致。随机分配不能消除所有偶然差异,却能减少“本来就更愿合作的人恰好都进入同一条件”所带来的混淆。
例如,信息组的平均投入若高于基准组,我们只能说在本实验的其余条件相同、样本和随机分配足够可靠的前提下,公开匿名记录与更高投入相伴,并可作为信息机制影响合作的证据。若另行比较惩罚组,还要继续看总收益:如果参与者为了报复频繁付出惩罚成本,投入上升未必意味着净收益上升。制度评价不能只看一个漂亮指标。
轮次安排也会影响你能问的问题,包括:
研究者不能把这些设计选择藏在“实验细节”里,因为它们本身就是制度的一部分。

把规则改得复杂并不等于研究更贴近现实。复杂制度可能同时改变理解难度、注意力、情绪和计算负担,使结果不再能归因于原本想研究的那个机制。一个有用的原则是:先用最简设计识别核心权衡,再逐步加入现实中不可忽略的因素;每增加一个部件,都要说明它解决了什么问题,又引入了什么新解释。
实验室里最容易被忽略的工作,往往发生在按下“开始”之前。研究问题、主假设、样本规模的依据、排除规则、主要结果指标和分析方法应尽量预先确定并留痕。预先承诺不是为了禁止探索,而是为了区分“按原计划检验的证据”和“看到数据后新发现的线索”。后者同样重要,但应被诚实地标为探索,等待新的数据或重复研究检验。
雨水花园实验至少应保存四类记录:规则版本与时间线、参与者在每轮的选择、随机分配和实际分组、报酬计算及理解题结果。若中途修改说明、软件出错、有人退出或某一场次提前结束,也应写入记录。只保留“好看”的场次,或者只报告支持预期的指标,会让看似精确的结果失去可信度。

分析时先确认数据的层级。四个人在同一小组里互相影响,不能轻率地把每一次点击都当作彼此独立的观察。十轮重复数据也不是十个互不相关的新实验;它同时包含个人差异、组内互动和时间趋势。最直观的起点可以是比较各条件在每轮的平均投入、分布和小组总收益,再把组别与轮次结构纳入分析。无论使用何种统计工具,都应报告不确定性,并检查结论是否被少数极端小组、某一场次或特定排除规则驱动。
这里有一份可直接使用的研究者检查单:
把这套框架用于一次班级实验时,规模小并不意味着可以省略设计。一个可复做的课堂版本可以先把问题限定为:“匿名记录是否改变四人组在五轮公共品任务中的平均投入?”其操作步骤可以如下列表梳理:
教师提前准备两份内容完全相同(仅信息反馈有区别)的实验说明。
使用事先生成的随机分组表,将学生分别分配到“基准组”和“信息组”。
每位学生只获知自己的编号和本组规则,不了解其他组及成员信息。
第一轮正式游戏开始前,每人需独立完成两道与规则相关的计算题。
课堂结束后,可以采用以下方式收集和讨论参与者的信息:
在分析时,可以注意到以下情况:
需要注意的是:
一次负责任的汇报应同时展示支持与不支持原先预测的部分。例如,信息组平均投入略高,却只发生在前两轮,后面与基准组接近;这比一句“公开信息有效”更接近数据本身。报告也应给出每组人数、完整轮次、退出情况和所有预定结果指标,让读者知道结论靠什么站立。若班级样本很小,最合适的定位是教学演示或试运行:它用来发现说明是否清楚、软件是否可靠、可能的机制是什么,而不是代替充分样本和重复检验。
控制条件能增强内部解释力,但也带来外推的难题。比如,校园实验与真实社区项目间存在多方面差异,关键维度可总结如下:
实验不是“现实的缩小版”,而是特定条件下机制作用的证据。因此,现实分析时不能只问“实验像不像现实”,还要一项项对照关键机制是否一致,例如:
如果这些核心机制不同,实验结果只能提供假设参考,不能直接替代实地观察、行政数据或访谈等其他方法。多种方法各自解决不同层面的因果问题,彼此互补。关于伦理设计,不应只是事后的手续。请参考如下:
还需警惕一些常见误区:
实验帮助我们理解机制,但最终价值判断仍需社会广泛讨论和多重考量。
回到开头的雨水花园,你现在可以用比“大家为什么不合作”更精确的问题来描述它:当个人收益与小组收益分离时,信息、重复互动、沟通和问责分别改变了什么?投入提高后,小组的净收益是否也提高?这一机制与真实项目有哪些相同与不同?每一个问题都能导向不同的实验设计,也提醒我们不要把任何一组数据说得过大。
经济学实验室训练的不是把人变成方程里的符号,而是把直觉变成可检查的主张。先明确规则和预测,再以对照和记录追问因果;既重视反常结果,也承认结论的边界。当下一次有人说“只要这样设计,人们一定会合作”时,不妨把这句话带回实验室:在什么条件下、对谁、通过什么机制、代价又由谁承担?
严格操作流程并非为了追求形式,而是确保观测到的行为差异,能归因于信息设计本身,而非其他因素(如算数能力差异或获得不一致提示)。