“迭代囚徒困境”:合作并不一定需要善良的人
现实社会中,人们不断进行合作:企业建立长期关系,员工互相配合,国家遵守规则。但如果每个人都追求自身利益,合作为什么还能存在?
20世纪80年代,政治学家罗伯特·阿克塞尔罗德(Robert Axelrod)通过“迭代囚徒困境锦标赛”研究了这一问题。他发现,合作并不一定依赖道德理想,而可能是在长期互动中形成的一种有效生存策略。
从囚徒困境看合作难题
经典囚徒困境展示了个人利益与集体利益之间的冲突。
两个人可以选择合作或背叛:
双方合作,都能获得较好收益;
一方背叛、一方合作,背叛者获得最大收益;
双方都背叛,则双方收益下降。
在一次性博弈中,背叛似乎是理性选择,因为无论对方如何行动,背叛都不会让自己处于最差位置。
但如果双方都选择背叛,结果反而比双方合作更差。
现实中的关系通常不是一次性的。人与人、企业与企业、国家与国家之间都会反复互动,因此阿克塞尔罗德研究的是“迭代囚徒困境”:在长期重复博弈中,什么策略能够获得最大成功?
计算机锦标赛寻找合作规律
阿克塞尔罗德邀请不同领域的研究者提交计算机程序,让不同策略相互竞争。
比赛中,每个策略都会与其他策略进行多轮囚徒困境博弈,最终根据累计收益排名。
研究者提交的策略包括:
永远合作;
永远背叛;
根据对手行为调整的策略;
试图预测和利用对手的复杂策略。
结果令人意外:最成功的策略并不是最复杂的,而是极其简单的“一报还一报”(Tit for Tat)。
“一报还一报”为何成功?
“一报还一报”由阿纳托尔·拉波波特提出,规则只有三点:
第一轮主动合作;
之后复制对方上一轮行为;
对方合作就合作,对方背叛就回应背叛。
它的优势来自四个特点。
善良性:主动开启合作。
它不会首先背叛,因此容易与其他合作策略形成稳定关系,获得长期互利收益。
报复性:防止被持续利用。
如果对方背叛,它会立即回应背叛,使背叛者无法长期占便宜。合作能够存在,不仅需要善意,也需要防止剥削的能力。
宽容性:允许关系恢复。
它不会永久记仇。当对方重新合作时,它也恢复合作,从而避免一次冲突导致长期双输。
清晰性:行为容易预测。
对手能够快速理解它的规则:“你合作,我合作;你背叛,我回应。”这种可预测性降低了合作的不确定性。
其他策略为什么失败?
永远背叛在短期可能占优,因为它不会被合作方利用。但它无法建立合作关系。当环境中合作减少时,所有参与者只能获得较低收益,因此长期竞争力不足。
永远合作容易建立良好关系,但缺乏防御能力,会成为背叛者获利的对象。
一些复杂策略试图通过计算和欺骗获得优势,但它们往往面临误判和信任不足的问题。在长期互动中,稳定、透明的策略可能比复杂的操纵更有优势,在真实的人类社会中,能给人稳定预期的人,更可能在保护自身的同时推动互利合作,稳定本身就是一种降低双方交易成本的信号。
合作如何在竞争中进化?
阿克塞尔罗德进一步从进化博弈论角度分析不同策略的生存。
进化博弈论认为,某种行为策略如果能带来更高平均收益,就更可能被保留和传播。
研究表明,合作演化需要几个条件:
重复互动。
如果双方只见一次面,欺骗可能更有利;但如果未来仍会相遇,维护长期关系就更重要。
互相识别和回应。
合作方需要能够区分合作与背叛,并根据行为调整策略,否则合作容易被利用。
合作群体的形成。
合作通常不是瞬间扩散,而是在能够反复互动的小群体中逐渐形成。当合作群体收益更高时,它们可能进一步扩大。
因此,合作并不是单纯依靠善良产生,而可能是自利个体在长期竞争环境中形成的一种稳定行为模式。
对现实社会的启示
阿克塞尔罗德的研究并不意味着“善良一定成功”,现实社会还受到权力、制度、信息差等因素影响。但它揭示了一些重要规律:
长期关系会促进合作。当双方未来仍可能互动时,维护信誉通常比短期占便宜更有价值。
稳定合作需要善意和边界。没有防御能力的合作容易被利用,而完全不信任又无法形成合作。
清晰、一致的行为规则有助于建立信任。社会中的许多制度,本质上都是通过增加长期互动、提高背叛成本,让合作成为更理性的选择。
阿克塞尔罗德的研究说明,即使个体主要追求自身利益,只要存在重复互动和有效反馈机制,合作也可能自然形成,并成为竞争环境中的优势策略。
本文是《迭代囚徒困境锦标赛与合作进化(AI 生成)》的更新版。


