朝核危机中的囚徒困境

浅论朝核危机中朝美间囚徒困境

目前，朝核危机已经发展为攸关地区各国安危、纠结半岛周边四大国利益、影响东北亚地区格局变化的多边博弈。自从博弈论发展为一门科学理论以来，在国际政治中得到了广泛的应用，而朝核危机中的各方尤其是美朝双方的博弈带有明显的囚徒困境博弈模型的特征。

关键词：朝核危机囚徒困境国际博弈

一博弈论中的囚徒困境

二朝核危机中最关键的囚徒困境

国家间的博弈是动态的重复博弈，通过课上的学习，我们得知静态的，单次的囚徒博弈并不复杂，多数囚徒博弈经过多次重复后都能导致合作解，只有在重复博弈中遗留下来的才是最棘手的。而国家间博弈的长期性质决定了国际关系中出现的囚徒困境都是难解的，需要时间，智慧和忍耐。而朝核危机就是这样的情况。

迄今为止，朝鲜核问题经历了两次大危机。第一次是以1990年美国以其军事卫星照片为证据，指责朝鲜研制核武器而引起的。危机在1993年朝鲜拒绝国际原子能机构对其核设施的核查后达到高潮。1994年2月，朝鲜做出让步，同意国际原子能机构对其7个核设施进行核查，而美国也相应地宣布暂停1994年度的美韩军演。第二次朝核危机较第一次更为持久和危险，时至今日也未能得到完全解决。2002年10月3日，朝鲜外长对到访的美国助理国务卿凯利承认了朝鲜正在进行的核研究，并“废除”1994年达成的《朝核问题框架协定》。朝核危机再一次全面爆发。

纵观两次朝核危机的发展进程，不难发现危机的缘起是朝美在一系列关键问题上的根本分歧：朝鲜作为弱势的一方，需要保证自身的安全和政权的存续。在没有外部安全保证的条件下，朝鲜将核武器作为保证自己安全诉求的一件法宝，最终目的是迫使美国对其妥协，从行动上停止威胁朝鲜，最终放弃对朝敌对政策。美国则担心自身的安全和在东北亚地区的利益受到损害，核不扩散的原则遭到破坏。尤其在9.11事件之后，非传统安全因素在美国的安全考量中占据了前所未有的重要位置，在这种情况下，朝鲜这个“流氓国家”掌握核技术并将其扩散至其他“流氓国家”或极端组织手中的风险是美国不能承担的。因此，美国始终

将朝鲜半岛无核化作为自己不变的目标，并矢口否认朝鲜是核武器拥有国。

对美朝双方的立场做出总结，可以形成一个如下的囚徒困境模型：朝鲜的最终决策会是同美国妥协，作出弃核决定或者坚持自己强硬的拥核立场。美国政策工具的选择面则比朝鲜要宽，但最终决策也在接受朝鲜的要求，停止对朝鲜的敌视和制裁政策与继续遏制朝鲜并使其发生“政权变更”之间选择。由此观之，美朝之间的囚徒困境体现在若朝鲜弃核而美继续制裁，则朝鲜失去对美几乎是唯一的博弈筹码。若美放弃制裁，但朝鲜借机拥核，则朝鲜在博弈中能获得较为有利的地位，至少可以缓解目前的不利处境。从朝鲜方面看，1.假设美国不制裁朝鲜，朝鲜选择研究核武器会使自己有更强大的军事实力。2.假设美国制裁朝鲜，朝鲜还是应该选择研究核武器，起码会有强大的军事实力。所以不管美国怎样选择，朝鲜最终出于自己利益最大化考虑，会选择研究核武器。从美国方面看也是同样的道理，不管朝鲜做何决定，制裁朝鲜会是最优选择。所以，双方会选择一个从整体上来说，对双方都不利的情况，即朝鲜选择核武，美国选择制裁。这就是美朝之间囚徒困境的纳什均衡点。

美朝间存在的囚徒困境可以用表格表示如下：

记朝鲜拥核收益为1，美继续制裁朝鲜收益为1，朝鲜拥核而美放弃制裁，朝鲜收益为2，反之亦然。则：

弈。“一报还一报”策略(tit—for—tat)为其中优选策略。而美国在博弈中无疑是执行了这种优选策略。但是博弈仍然进入了僵局。因为朝核问题不仅涉及美朝双方，在其他参与博弈的利益主体之间也或多或少存在着类似的囚徒困境。朝核问题中的多方囚徒困境是由若干个两方囚徒困境组成的，这一组一组的利益博弈间存在着相互牵制的作用，影响到了彼此从困境中的逃逸。更重要的是，美朝双方根深蒂固的不信任感阻碍了协议的执行。

三囚徒困境的解决与中国在其中的作用

值得注意的是，美朝之间博弈还有一个最显著的特征，那就是博弈双方力量的失衡：一方是被封锁，制裁，面临着严重经济困难的弱小国家，另一方是无可争议的世界霸主。在博弈的筹码上，朝鲜的筹码分量虽重，但却单一且不可靠。而美国的筹码较之朝鲜可以说是多种多样，经济，政治，军事上都有可以让步的余地。制约美国的，是它追求绝对安全的欲望和基于进攻性现实主义行动逻辑之上的对东亚霸权的恋恋不舍。

进攻性现实主义是一种为美国的全球霸权服务的理论，这种理论将其他不同于美国的地区大国作为主要博弈对手。在朝核危机中，美国对朝鲜施加压力不仅仅出于保证自身绝对安全的逻辑，更有借机巩固在东亚的力量存在，遏制地区大国，尤其是中国的意图。所以美国并不急于解决朝核问题。而一旦要解决，最符合美国利益的方案必然是在剥夺朝鲜核力量的同时，通过“政权变更”，彻底消除这个对美国怀有强烈敌意的政权。因此，从美国角度看，最不值得担心的结局就是博弈的长期重复。因为这在某种程度上是符合美国利益的。博弈的长期重复对中国却是有害的。

中国在解决朝核危机中起着不可替代的作用：从历史的角度来看，朝鲜同中国山水相依，两国同饮鸭绿江，图们江水。中朝之间血脉相连，在中国有大量的朝鲜族居民。在漫长的古代史中，朝鲜是同中国关系最密切的藩属之一，中国曾经为了保卫这个“小中华”而不惜一战。甲午战争之后，中国在朝鲜的传统影响力被战败所剥夺，朝鲜民族随后也进入了被俄，

日等帝国主义国家侵犯民族利益的黑暗岁月。通过参加五十年代的朝鲜战争，中国在朝鲜重拾了甲午战争后丧失的巨大影响力。时至今日，在朝核问题的谈判桌上，中朝之间“鲜血凝成的友谊”是中国对半岛局势施加影响的最有力筹码，与会各方都不能忽视中国在解决问题中所贡献出的力量。中方在朝核问题上一贯坚持3项主张：第一是要维护朝鲜半岛的和平与稳定；第二是要通过外交和政治手段解决有关分歧；第三是一定要实现朝鲜半岛的无核化，这也是朝核问题的核心所在。这3项主张，代表了中国在朝核危机中的基本态度，是由半岛无核化符合中国国家利益这一基本事实所决定的。

目前为止，中国在朝核危机中的角色一直是一个斡旋者。朝核问题形成今天的困局，责任不在中国。第一次朝核危机之后美国对朝的政策定位主要是对话和接触，但布什政府上台之后，单边主义大行其道，对朝政策转为以遏制和敌视为主，这种进攻性现实主义的政策取向使得朝鲜再次面临巨大的安全威胁，也是第二次朝核危机爆发的诱因。此时中国作为东北亚地区负责人的大国，在美朝对抗升级之后始终没有放弃努力，在汲取以往会谈经验和教训的基础之上，积极斡旋，终于促成了由与朝鲜半岛安全局势密切相关，一度是朝核危机解决最大希望的六方会谈。六方会谈迄今为止共进行了六轮，为东北亚地区的稳定和繁荣作出了巨大的贡献。奥巴马政府上台之后，尽管在中东和中亚采取缓和政策，宣布从伊拉克，阿富汗逐步撤军，但对于东亚地区的纠纷仍然持僵化立场。美国的强硬和朝鲜对自身安全的担忧最终形成了一个恶性循环，导致朝鲜一而再再而三的做出不见容于国际社会，违反先前达成协议的强硬行为。六方会谈的无限期中止就是这种难以解决的囚徒困境的最佳写照。

朝核危机的僵局主要是美朝之间的僵局，在这一僵局已严重威胁东北亚安全和中国国家利益的当下，中国更不能放弃责任，立场后退。尽管中国握有种种有利条件，然而今日朝核危机的走向对中国来讲并非福音。因为危机的恶化，导致美国在中国周边海域大肆军演，恶化了中国的安全环境。朝鲜的核试验也背离了我国一贯推动半岛无核化的初衷，而且有引发核军备竞赛的危险——日本就是一个拥有雄厚核技术储备的国家。一旦周边国家争先发展核武器，那对于中国国家安全的损害将是不可估量的。这也是我国对朝鲜核试验十分不满的原因所在。

四结语

第二次朝核危机的爆发距今已将近十年，在这段时间里，世界格局发生着深刻的变化，博弈各方的力量对比也在不断改变。今日的中国在综合国力上虽仍不及美国，但在东亚诸国中已经成为领头羊。2010年中国国内生产总值(GDP)为5.88万亿美元，超过日本的5.47万亿美元，仅次于美国居世界第二。中国的经济高速发展，政治上占据大国地位，话语权逐步扩张，军事现代化稳步推进。在拥有前所未有的力量之后，如何明智的运用这种力量成为摆在我国政府和学界面前的一个重要课题。要慎重的和明智的运用强大的综合国力，我们必须以谨慎、理智的态度，慎重地对待朝核危机中的每一个细节和发展情况，及时地提出应对对策，充分发挥中国的大国作用，提升大国形象，捍卫国家利益。

浅析博弈中的囚徒困境

浅析博弈中的囚徒困境班级：姓名：学号：

摘要：囚徒困境是博弈论的非零和博弈中具代表性的例子，个人最佳选择并非团体最佳选择，个人理性有时会导致集体的非理性——机关算尽却因而作茧自缚，这就是囚徒困境所反映的问题。一经典的囚徒困境 “囚徒困境”是1950年美国兰德公司的梅里尔·弗勒德（Merrill Flood）和梅尔文·德雷希尔（Melvin Dresher）拟定出相关困境的理论，后来由顾问艾伯特·塔克（Albert Tucker）以囚徒方式阐述，并命名为“囚徒困境”。两个共谋犯罪的人被关入监狱，不能互相沟通情况。如果两个人都不揭发对方，则由于证据不确定，每个人都坐牢一年；若一人揭发，而另一人隐瞒，则揭发者因为立功而立即获释，隐瞒者因不合作而入狱五年；若互相揭发，则因证据确实，二者都判刑三年。从集体上看，他们应当互相合作，都隐瞒，这样总服刑时间最短（为2年）。但他们会仔细考虑对方可能采取什么样的选择，并从自身利益出发做出选择。他们会意识到，如果同伙隐瞒而自己背叛，就能使自身利益最大化（0年）。但他也意识到，他的同伙也不傻，也会这样来设想，这样的话，他就更不可能让同伙得利（服刑0年）而自己受害（服刑5年）所以结论就是，唯一正确的选择就是背叛同伙，把一切都告诉警方，如果他的同伙保持隐瞒，那么他就会是那个获释出狱，服刑0年。而如果他的同伙也向警方交代了，那么，他只需服刑3年而不是5年。所以结果只能是两个囚犯都坐牢服刑3年，而不是都服刑1年。所以对于他们个人来说都是理性的，然而对集体来说却是非理性的。二重复多次如果囚徒困境的情况重复多次，会有什么新的变化？假设重复10次。我们可以合理地设想，如果囚徒第一次被对方指控，第二次这个囚徒也会指控对方。相反，如果第一次相反，如果第一次别人保持隐瞒，建立了互信的关系，你也会保持隐瞒，导致最优。当然，两个囚徒都会有相似的想法，在第一局保持隐瞒，以期望建立互信关系，所以双方都会保持隐瞒。第二局时，双方亦应有相似的想法，继续保持隐瞒，以期继续在互信的情况下进行第三局，

浅析囚徒困境与纳什均衡

浅析囚徒困境囚徒困境是博弈论的非零和博弈中具代表性的例子，指反映个人最佳选择并非团体最佳选择。囚徒困境的经典案例这里不再复述，让我们看一下身边的例子。囚徒困境在生活中最常见的表现就是挤公共汽车。从集体理性的角度来看,按次序上车是最有效率的做法,但是你挤我不挤,我就可能上得慢,所以每个人的最优战略都是挤,结果上车就更慢了。学生也同样遭遇囚徒困境：减轻中小学生过重负担喊了20多年，仅1985年至2000年的15年里，中央就下达“减负令”49次。但实际情况却是学生课业负担不但没减下来，反倒呈现出越演越烈之势，致使学生作业做到深夜、节假日仍然上课、业余时间奔忙于各种补习班等。可见“减负令”难以见效，中小学生课业负担不减反增。又比如近年来炒得火热的楼市——“我没买房，结果房价还是涨了，因为我们无法保证大家都不买房。可是，我错了吗？没有。当初如果我买房了，房价下跌了呢？因为我不能保证大家都买房。人们根本不能预知在疾风暴雨式的调控之下，房价竟还能且调且涨。可是，我对了吗？没有。”这是一部眼下流行、充满黑色幽默的网络视频《北漂族的无房生活》中的经典对白。含泪的“调侃”折射出当下楼市的“囚徒困境”：买，难担高房价重负；不买，难受房价节节攀升的煎熬。再看中国的法治之路。虽然法治让所有人都长期受益，甚至执政者自己也不例外，但是一个狭隘理性社会却偏偏无力支撑法治，以至最后每个理性人都不得不忍受法治缺位的非理性之苦。绝大多数中国人都是很识时务的理性人，不会故意给自己找茬，多数律师也不例外。不过，任何事物都有两面性，“理性”过了头也就成了非理性。这就是充斥着当今中国社会的“囚徒困境”：一种行为模式对于个人看起来是很理性的，但是对于个人构成的集体来说却是非理性的，最后对于每个人来说也是非理性的。我们都不敢站出来说话，对每个人来说都是很“理性”的一种行为方式，但最后的结果只能是让整个社会丧失法治。但囚徒困境一定是坏事吗？就以囚徒困境的经典案例来说，作为一个比喻，我们会为囚犯不能合作而遗憾；可是如果它发生在现实中，我们就巴不得他们不能合作。然而如果是多次博弈，人们就有了合作的可能性，囚徒困境就有可能破解，合作就有可能达成。连续的合作有可能成为重复的囚徒困境的均衡解，这也是博弈论上著名的“大众定理”的含义。但合作的可能性不是必然性。博弈论的研究表明，要想使合作成为多次博弈的均衡解，博弈的一方（最好是实力更强的一方）必须主动通过可信的承诺，向另一方表示合作的善意，努力把这个善意表达清楚，并传达出去。比如在楼市的囚徒困境中，政府能适当调控房价，给予购房者房价稳定合理的承诺，那么楼市的囚徒困境是有可能破解的。在重复的囚徒困境中，博弈被反复地进行。因而每个参与者都有机会去“惩罚”另一个参与者前一回合的不合作行为。这时，合作可能会作为均衡的结果出

浅谈博弈论中的囚徒困境的解决方法

浅谈博弈论中的囚徒困境的解决方法摘要：囚徒困境是博弈论中的一个重要范例，这个问题涉及各个领域。本文通过三个简单的实例，来谈谈解决的方法。案例一：一个面馆的囚徒困境我曾经在路边一个小店里吃面，由于当时客人不是很多，就顺便与小老板聊了起来。通过老板的介绍听出了一些门道。以前面馆开店的时候请了一个师傅，开始的时候为了调动他的积极性他们采用按销售量分成，一碗面给5毛钱提成。这样的话，客人越多他挣得也就越多，为了吸引更多的顾客，他在碗里放很多的肉来吸引回头客，一碗面才6块钱，本来就靠薄利多销，他放的肉多，面馆自然也赚不到钱。后来呢，就换了一个结算方式，给厨师发固定的工资，这样客人多少跟他没有什么关系，但是新的问题又出现了，这次他在碗里放肉放很少，基本上把所有的客人都赶走了。客人少了，他就轻松了啊反正他拿的是固定的工资。通过这个案例我们可以了解到面馆的老板与厨师在工资的分配上存在一定的分歧，由于没有处理好，使得双方都处在不利的结局。解决方法：面馆的老板应该对厨师明确，每碗面的元材料是固定的，大师傅的工资还是按照销售量提成走，但是前题是每个月使用的原材料不能超额，否则只有基本工资。或者就规定每碗面里就放多少克肉。此外，还有一个更简单的办法就是：面馆的小老板亲自放肉。因为关键的资源一定要掌握在关键的人手里。经过以上的分析，我们可以得知解决的方法：1.工资加提成的制度确实能调动员工的积极性；2.权利下放可以，但是要有度；3.员工的工资提成不能只和销量挂钩，应该和老板的利润挂钩。4.有效的沟通、激励，平时给员工传达精神的奖励，让员工认为自己也是公司的主人。案例二：小餐馆的囚徒困境在天津新建的一片经济适用房社区里有两家小餐馆，他们都是经营当地的家常炒菜及快餐。因为这里是新开发的经济适用房，而周边像小饭馆这样的生活配套设施很缺乏，所以附近的建筑工人都是在这两家小饭馆解决三餐。这两家餐馆因为在口味、价格、菜的品种等都基本相同，所以一直以来这两家面对都是这些人，营业额都差不多，而附近的建筑工人们对于吃饭也没有什么特殊的爱好。好景不长，就在今年的夏天，两家餐馆的其中一家，暂且称为A

博弈论论文囚徒困境的启示和思考

囚徒困境的启示和思考二、囚徒困境的解释如同博弈论的其他例证，囚徒困境假定每个参与者（即“囚徒”）都是利己的，即都寻求最大自身利益，而不关心另一参与者的利益。参与者某一策略所得利益，如果在任何情况下都比其他策略要低的话，此策略称为“严格劣势”，理性的参与者绝不会选择。另外，没有任何其他力量干预个人决策，参与者可完全按照自己意愿选择策略。囚徒到底应该选择哪一项策略，才能将自己个人的刑期缩至最短？两名囚徒由于隔绝监禁，并不知道对方选择；而即使他们能交谈，还是未必能够尽信对方不会反口。就个人的理性选择而言，检举背叛对方所得刑期，总比沉默要来得低。试设想困境中两名理性囚徒会如何作出选择：若对方沉默、背叛会让我获释，所以会选择背叛。若对方背叛指控我，我也要指控对方才能得到较低的刑期，所以也是会选择背叛。二人面对的情况一样，所以二人的理性思考都会得出相同的结论——选择背叛。背叛是两种策略之中的支配性策略。因此，这场博弈中唯一可能达到的纳什均衡，就是双方参与者都背叛对方，结果二人同样服刑8年。这场博弈的纳什均衡，显然不是顾及团体利益的帕累托最优解决方案。以全体利益而言，如果两个参与者都合作保持沉默，两人都只会被判刑1年，总体利益更高，结果也比两人背叛对方、判刑8年的情况较佳。但根据以上假设，二人均为理性的个人，且只追求自己个人利益。均衡状况会是两个囚徒都选择背叛，结果二人判决均比合作为高，总体利益较合作为低。这就是“困境”所在。实际上囚徒困境在我们的实际生活中也有很多，下面举两个进行说明

三、经济学例子：关税战两个国家，在关税上可以有以两个选择: 提高关税，以保护自己的商品。（背叛）与对方达成关税协定，降低关税以利各自商品流通。（合作）当一国因某些因素不遵守关税协定，独自提高关税（背叛），另一国也会作出同样反应（亦背叛），这就引发了关税战，两国的商品失去了对方的市场，对本身经济也造成损害（共同背叛的结果）。然后二国又重新达成关税协定。（重复博弈的结果是将发现共同合作利益最大。）四、商业例子：广告战商业活动中亦会出现各种囚徒困境例子。以广告竞争为例。两个公司互相竞争，二公司的广告互相影响，即一公司的广告较被顾客接受则会夺取对方的部分收入。但若二者同时期发出质量类似的广告，收入增加很少但成本增加。但若不提高广告质量，生意又会被对方夺走。此二公司可以有二选择：互相达成协议，减少广告的开支。（合作）增加广告开支，设法提升广告的质量，压倒对方。（背叛）若二公司不信任对方，无法合作，背叛成为支配性策略时，二公司将陷入广告战，而广告成本的增加损害了二公司的收益，这就是陷入囚徒困境。在现实中，要二互相竞争的公司达成合作协议是较为困难的，多数都会陷入囚徒困境中。除了这些还有的很多类似的例子，比如说公共产品的提供，商家的价格战等等，在这里就不多赘述了。五、“囚徒困境”现象的意义和启示通过以上几个关于囚徒困境的例子，特别是作为经济管理学院的学生，我们可以将博弈论的一些知识运用好，更好的指导我们的经济生活。理论的重要意义在于类似的情况之下给人们社会经济生活带来指导。在经济发展中，我们应该认识到“看不见的手”还有更多内涵，有待我们去发掘。本文主要通过对该理论的分析，从中发现对企业经营管理活动的有义启示。第一，在市场竞争过程中，一名优秀的经营者，无论做任何决策还是考虑问题应该有战略眼观，特别是在做出对企业乃至行业今后发展的竞争策略时，从长远出发，做正确的决断。第二，保存对手就是保存自己。在市场竞争中，让竞争对手发展就是自己发展，本着求同存异的思想，共谋发展，避免恶性竞争，避免两败俱伤的情况。第三，市场竞争不是纯粹的竞争，在义和利之间应该如何取舍，是一位有战略眼观的企业家该做的第一个选择。 2杜兰：走出“囚徒困境”《通信企业管理》[J] 2003年第4期，第31页

浅析“囚徒困境”模型中的“理性”假设

浅析“囚徒困境”模型中的“理性”假设 “囚徒困境”博弈模型中个体理性和集体理性的冲突对经济学的基本假设——“理性经济人”造成了严重挑战。认为“囚徒困境”中之所以出现表面的理性冲突是因为囚徒并非真正理性，之后笔者试着给出了两种可以化解这种冲突的方案：一种是改变博弈的理性选择方式，一种是集体理性工具说或集体利益幻象说，这一过程构成笔者对“理性经济人”假设的反思。标签：“理性经济人”假设；囚徒困境；个体理性；集体理性引言 “理性经济人”假设是西方经济学理论分析的逻辑起点，它为构建精致庞大的经济学理论体系奠定了一个公理化的起点。在以此为前提取得了丰硕的理论研究成果的同时，它也遭到了众多批判和质疑。1950年普林斯顿大学的塔克（Tucker）教授提出的“囚徒困境”博弈模型是对这一假设的有力冲击。在这一模型里，每个囚徒都是“理性的”，而且他们也都知道对方是“理性的”，每个囚徒都选择了对自己而言是理性的“占优策略”，而结果对每个人而言却都是次劣的，对集体而言则是最劣的[1]，这不符合“理性经济人”假设的逻辑结果，即个体理性的利益最大化行为的自然结果即是集体利益的最大化。这促使笔者思考，或者是研究者们在这一模型里对“理性经济人”假设的理解有偏差，或者是这一假设本身即有暗伤存在，囚徒博弈只是帮助我们发现了这一点；或者是这一假设根本不适用于分析该模型中囚徒的策略选择行为，这一点显然是试图逐渐扩张到解释预测一切人类行为的帝国主义经济学所不愿意承认的。而笔者深信，每个囚徒可以选择的“沉默”（合作）与“坦白”（背叛）两种策略不可能都是不理性的，至少有一个策略是相对最为理性的；同样，仅有可能出现的四种结果（最优，次优，次劣，最劣）也不可能对于每个囚徒而言都是不理性的，至少有一个结果是相对最为理性的[2]，在模型中如何使理性的策略与理性的结果统一起来，即实现手段理性与目标理性的统一，这是理性的任务。一、“囚徒困境”及其出现的原因分析 “囚徒困境”博弈模型最初由普林斯顿大学的塔克教授提出。经典的“囚徒困境”如下所述[3]：两个囚徒被警察抓住后分别关押，警方知道他们有罪，但是苦于缺乏充足的证据。警察给他们的政策是“坦白从宽，抗拒从严”。每个囚徒面临的两个策略选择“沉默”（合作）和“坦白”（背叛）。如果一方“坦白”，而另外一方“沉默”，则坦白方将被释放，而沉默方将被判重刑10年；如果双方均“坦白”，则每人将被判刑8年；如果双方均“沉默”，警方因为没有足够的证据而只能给他们轻微的象征性惩戒，判刑半年。他们的支付矩阵如下所示:

生活中的囚徒困境

生活中的—“囚徒困境” 摘要：数学源自生活，生活中处处可见数学之美，博弈论—数学的一个分支，无疑在经济、军事、生物、政治等方面发挥了不可替代的作用。博弈论是二人在平等的对局中各自利用对方的策略变换自己的对抗策略，达到取胜的目的。所谓奕者即博者，在中国很早便存在博弈论的思想。如“世事洞明皆学问，人情练达即文章”，更有“画龙画虎难画骨，知人知面不知心”、“逢人且说三分话，未可全抛一片心。”博弈论中著名的“囚徒困境”在生活中最为真实体现，本文即从囚徒困境出发，寻找生活中“囚徒困境”的例子，如学生减负，商业之间的广告战、价格战等等，阐述了生活中的“囚徒困境”。囚徒困境—忠诚还是背叛这是一个问题经典案例：“警察与小偷的故事” 在博弈论中，一个著名例子是由塔克给出的“囚徒困境”博弈模型“警察与小偷的故事”。假设有两个小偷A 和B 联合犯事、私入民宅被警察抓住。警方将两人分别置于不同的两个房间内进行审讯，对每一个犯罪嫌疑人，警方给出的政策是：如果两个犯罪嫌疑人都坦白了罪行，交出了赃物，于是证据确凿，两人都被判有罪，各被判刑8年；如果只有一个犯罪嫌疑人坦白，另一个人没有坦白而是抵赖，则以妨碍公务罪（因已有证据表明其有罪）再加刑2年，而坦白者有功被减刑8年，立即释放。如果两人都抵赖，则警方因证据不足不能判两人的偷窃罪，但可以私入民宅的罪名将两人各判入狱1年。表1给出了这个博弈的。表1 囚徒困境博弈 [Prisoner's dilemma] A ╲B 坦白抵赖坦白 -8，-8 0，-10 抵赖 -10，0 -1，-1 我们来看看这个博弈可预测的均衡是什么。对A 来说，尽管他不知道B 作何选择，但他知道无论B 选择什么，他选择“坦白”总是最优的。显然，根据对称性，B 也会选择“坦白”，结果是两人都被判刑8年。但是，倘若他们都选择“抵赖”，每人只被判刑1年。但他们都抵赖并非个人最优选择。不难看出，“坦白”是任一犯罪嫌疑人的占优战略，而（坦白，坦白）是一个占优战略均衡。生活中的“囚徒困境” 学生减负—书包越减越重学生减负的呼声在中国当代教育体制下越来越高，但结果是，辅导班越来越火、学生书包越来越重。表2将清楚的呈现学生各个选择的结果面对表2的结果，孩子和父母会做出怎样的选择呢？从“囚徒困境”中我们知道，所有的学生会选择增负而不是减负，如果所有人选择减负那么皆大欢喜，如果我选择了减负而别人选择了增负，我考试分数肯定会比别人低，那么我便不能考上好的学校接受更好的教育，在未来求职时我赶不上他人；如果我选择了增负，其他人选择减负，那我会在考试中获得优势。其他学生╲我减负增负减负所有人综合素质提高我能考好的大学，找好工作增负我的会比其他人低，考不上好的大学所有人都会拼命学习

论“囚徒困境”现象及其普遍意义

【摘要】本文从博奕论的经典命题“囚徒困境”现象出发，论述了“囚徒困境”现象及其普遍意义，“囚徒困境”现象与企业竞争情报以及价格战中的合作双赢；运用“囚徒困境”博奕对两个势均力敌的竞争对手之间的价格进行了分析，认为价格战是可以避免的，合作可以带来双赢。【关键词】博弈论囚徒困境企业竞争情报价格战合作双赢 “生活是一个永无止息的决策过程，我们每个人都无法逃避这样的现实：或是成为某个策略的影响者，或是被某个策略所影响。其实，我们每个人都是生活这场游戏的策略家。既然这样，当一个出色的策略家总比当一个蹩脚的策略家更好一点。” 目前博弈论的发展正越来越受到各个领域的重视，因为在现实生活中矛盾和冲突总是无所不在，而利用博弈论可以帮助我们很好地解决这些现实生活中的矛盾和冲突问题。由此可见，如何在矛盾和冲突中成功的选择和运用策略是一个很有意义的问题。一、“囚徒困境”现象及其普遍意义 1.“囚徒困境”现象 “囚徒困境”（Prisoner， s Dilemma）的具体内容如下：两个嫌疑犯作案后被警察逮捕，分别关在不同的屋子里审讯，警察告诉他们，如果两个人都坦白，那么每个人判刑8年；如果两个人都抵赖，每个人判刑1年（或许因为证据不足）；如果其中一个人坦白，另一个人抵赖的话，坦白的人释放，抵赖的人判刑10年。在这个博奕中，纳什均衡是（坦白，坦白），尽管从总体上看，（抵赖，抵赖）是对两个人都有益的结果，但由于不构成纳什均衡，所以不是该博奕的解。给定B坦白的情况下，A的最优战略选择是坦白，AB最优战略的组合（纳什均衡）却不是总体最优的选择。有没有可能其中一个人选择抵赖呢？按照人是理性的假设，没有人会积极地这么做，因为如果对方坦白的话，自己就可能被判刑10年，理性的人是不会冒这种风险的。囚徒困境反映了一个深刻的哲学问题：个人理性和集体理性的矛盾。在这个博奕中，两个博奕方对对方的可能得益完全知晓，并且各自独立作出策略选择。每个博奕方选择自己的策略时，虽然无法知道另一方的实际选择，但

囚徒困境博弈的行为博弈均衡分析

囚徒困境博弈的行为博弈均衡分析 Christopher Stephens: Modelling Reciprocal Altruism, The British Journal for the Philosophy of Science, vol.47, No.4, 1996, pp.533-551. 互动利他主义建模 1、利他主义困惑与标准模型 The altruism puzzle and the standard model 在一个囚徒困境博弈中，每个博弈者都有两种可能选择：背叛（Defect）或合作（Cooperate），可一般表示为：囚徒困境博弈要求两个主要条件：（1）Y>W>Z>X（命令条件，The ordering condition）；（2）(Y+X)<2W（反利用条件，The anti-exploitation condition）尽管“背叛”策略是一次性博弈中每个博弈者的优超选择，但相互合作却比相互背叛要好。 2、利他主义的非正式条件 Informal condition for reciprocal altruism 3、对反利用条件的Axelrod证明的批评 Criticism of Axelrod’s justification of the anti-exploitation condition 4、相互利他主义的一组正式模型 A menu of formal models of reciprocal altruism 5、对于guppies、baboons和bats模型的互动利他主义建模 Modelling reciprocal altruism in guppies, baboons, and bats （1）建模guppies的同时合作

“囚徒困境”引发的思考

“囚徒困境”引发的思考 “囚徒困境”博弈是图克（Tucker）1950年提出的一个著名的博弈模型，是完全信息静态博弈的典型例子。一、基本模型囚徒困境博弈的基本情况如下：警察抓住了两个合伙犯罪的罪犯，但却缺乏足够的证据指证他们所犯的罪行。如果其中至少有一人供认犯罪，就能确认罪名成立。为了得到所需的口供，警察将这两名罪犯分别关押以防止他们串供或结成攻守同盟，并给他们同样的选择机会；如果他们两人都拒不认罪，则他们会被以较轻的妨碍公务罪各判1年徒刑；如果两人中有一人坦白认罪，则坦白者从轻认罪，立即释放，而另一人则将重判8年徒刑；如果两人同时坦白认罪，则他们将被各判5年监禁。如果分别用－1、－5和－8 表示罪犯被判刑1年、5年和8年的得益，用0表示罪犯被立即释放的得益，则两囚徒的得益矩阵如下：囚徒2 坦白不坦白囚徒1 坦白－5，－5 0，－8 不坦白－8，0 －1，－1 在上图中，“囚徒1”、“囚徒2”分别代表本博弈中的两个博弈方，也就是两个罪犯；他们各自都有“不坦白”和“坦白”两种可选择的策略；因为这两个囚徒被隔离开，其中任何一人在选择策略时都不可能知道另一人的选择是什么，因此不管他们决策的时间是否真正相同，我们都可以把他们的决策看作是同时做出的。其中矩阵中第一个数字代表决策结果后囚徒1的得益，第二个数字代表决策结果后囚徒2的得益。博弈的结果是：由于这两个囚徒之间不能串通，并且各人都追求自己的最大利益而不会顾及同伙的利益，双方又都不敢相信或者说指望对方有合作精神，因此只能实现对他们都不理想的结果（各判5年），并且这个结果具有必然性，很难摆脱，因此这个博弈被称为“囚徒困境”。［1］二、关于完全理性的思考囚徒困境博弈的一个假设是博弈方都是完全理性。完全理性来源于经济学中的理性人假设，即博弈方都以个体利益最大化为目标，且有准确的判断选择能力，也不会“犯错误”。以个体利益最大为目标被称为“个体理性”，有完美的分析判断能力和不会犯选择行为的错误称为“完全理性”。完全理性包括追求最大利益的理性意识、分析推理能力、识别判断能力、记忆能力和准确行为能力等多方面的完美性要求，其中任何一方面不完美就不属于完全理性。［1］我们可以看出，这是一个要求非常严格的假设。即便如此，完全理性仍在一个方面没有做出规定（至少是没有意识到或明确地规定出来），就是思维方式，也即是博弈方是以将问题分解的方式来思考问题呢，还是以系统的整体的方式来思考问题的。我引用《第五项修炼》上的一段话来表达这两种思维方式的不同。自幼我们就被教导把问题加以分解，把世界拆成片片段段来理解。这显然能够使复杂的问题容易处理，但是无形中，我们却付出了巨大的代价——全然失掉对“整体”的连属感，也不了解自身行动所带来的一连串后果。于是，当我们想一窥全貌时，便努力重整心中的

博弈论中的囚徒困境在生活中的应用

博弈论中的囚徒困境在生活中的应用囚徒困境最早出现在1950年，由就职于兰德公司的梅里尔·弗勒德（Merrill Flood）和梅尔文·德雷希尔（Melvin Dresher）拟定出相关困境的理论，后来由顾问艾伯特·（AlbertTucker）以囚徒方式阐述，并命名为“囚徒困境”。经典的囚徒困境如下：警方逮捕甲、乙两名嫌疑犯，但没有足够证据指控二人入罪。于是警方分开囚禁嫌疑犯，分别和二人见面，并向双方提供以下相同的选择：若一人认罪并作证检控对方（相关术语称“背叛”对方），而对方保持沉默，此人将即时获释，沉默者将判监10年。若二人都保持沉默（相关术语称互相“合作”），则二人同样判监半年。若二人都互相检举（互相“背叛”），则二人同样判监2年。如同博弈论的其他例证，囚徒困境假定每个参与者（即“囚徒”）都是利己的，即都寻求最大自身利益，而不关心另一参与者的利益。参与者某一策略所得利益，如果在任何情况下都比其他策略要低的话，此策略称为“严格劣势”，理性的参与者绝不会选择。另外，没有任何其他力量干预个人决策，参与者可完全按照自己意愿选择策略。囚徒到底应该选择哪一项策略，才能将自己个人的刑期缩至最短？两名囚徒由于隔绝监禁，并不知道对方选择；而即使他们能交谈，还是未必能够尽信对方不会反口。就个人的理性选择而言，检举背叛对方所得刑期，总比沉默要来得低。试设想困境中两名理性囚徒会如何作出选择：（1）若对方沉默、背叛会让我获释，所以会选择背叛。（2）若对方背叛指控我，我也要指控对方才能得到较低的刑期，所以也是会选择背叛。二人面对的情况一样，所以二人的理性思考都会得出相同的结论——选择背叛。背叛是两种策略之中的支配性策略。因此，这场博弈中唯一可能达到的纳什均衡，就是双方参与者都背叛对方，结果二人同样服刑2年。这场博弈的纳什均衡，显然不是顾及团体利益的帕累托最优解决方案。以全体利益而言，如果两个参与者都合作保持沉默，两人都只会被判刑半年，总体利益更高，结果也比两人背叛对方、判刑2年的情况较佳。但根据以上假设，二人均为理性的个人，且只追求自己个人利益。均衡状况会是两个囚徒都选择背叛，结果二人判决均比合作为高，总体利益较合作为低。这就是“困境”所在。例子漂亮地证明了：非零和博弈中，帕累托最优和纳什均衡是相冲突的。一，囚徒困境之于异地恋

浅析囚徒困境与纳什均衡之欧阳家百创编

浅析囚徒困境欧阳家百（2021.03.07）囚徒困境是博弈论的非零和博弈中具代表性的例子，指反映个人最佳选择并非团体最佳选择。囚徒困境的经典案例这里不再复述，让我们看一下身边的例子。囚徒困境在生活中最常见的表现就是挤公共汽车。从集体理性的角度来看,按次序上车是最有效率的做法,但是你挤我不挤,我就可能上得慢,所以每个人的最优战略都是挤,结果上车就更慢了。学生也同样遭遇囚徒困境：减轻中小学生过重负担喊了20多年，仅1985年至2000年的15年里，中央就下达“减负令”49次。但实际情况却是学生课业负担不但没减下来，反倒呈现出越演越烈之势，致使学生作业做到深夜、节假日仍然上课、业余时间奔忙于各种补习班等。可见“减负令”难以见效，中小学生课业负担不减反增。又比如近年来炒得火热的楼市——“我没买房，结果房价还是涨了，因为我们无法保证大家都不买房。可是，我错了吗？没有。当初如果我买房了，房价下跌了呢？因为我不能保证大家都买房。人们根本不能预知在疾风暴雨式的调控之下，房价竟还能且调且涨。可是，我对了吗？没有。”这是一部眼下流行、充满黑色幽默的网络视频《北漂族的无房生活》中的经典对白。含泪的

“调侃”折射出当下楼市的“囚徒困境”：买，难担高房价重负；不买，难受房价节节攀升的煎熬。再看中国的法治之路。虽然法治让所有人都长期受益，甚至执政者自己也不例外，但是一个狭隘理性社会却偏偏无力支撑法治，以至最后每个理性人都不得不忍受法治缺位的非理性之苦。绝大多数中国人都是很识时务的理性人，不会故意给自己找茬，多数律师也不例外。不过，任何事物都有两面性，“理性”过了头也就成了非理性。这就是充斥着当今中国社会的“囚徒困境”：一种行为模式对于个人看起来是很理性的，但是对于个人构成的集体来说却是非理性的，最后对于每个人来说也是非理性的。我们都不敢站出来说话，对每个人来说都是很“理性”的一种行为方式，但最后的结果只能是让整个社会丧失法治。但囚徒困境一定是坏事吗？就以囚徒困境的经典案例来说，作为一个比喻，我们会为囚犯不能合作而遗憾；可是如果它发生在现实中，我们就巴不得他们不能合作。然而如果是多次博弈，人们就有了合作的可能性，囚徒困境就有可能破解，合作就有可能达成。连续的合作有可能成为重复的囚徒困境的均衡解，这也是博弈论上著名的“大众定理”的含义。但合作的可能性不是必然性。博弈论的研究表明，要想使合作成为多次博弈的均衡解，博弈的一方（最好是实力更强的一方）必须主动通过可信的承诺，向另一方表示合作的善意，努力把这个善意表达清楚，并传达出去。比如在楼市的囚徒困境中，政府能

博弈论中经典案例--“囚徒困境”

博弈论中经典案例--“囚徒困境” 博弈论中有一个经典案例--“囚徒困境”。两个共谋犯罪的人被关入监狱，不能互相沟通情况。如果两个人都不揭发对方，则由于证据不确定，每个人都坐牢一年;若一人揭发，而另一人沉默，则揭发者因为立功而立即获释，沉默者因不合作而入狱十年;若互相揭发，则因证据确实，二者都判刑八年。由于囚徒无法信任对方，因此倾向于互相揭发，而不是同守沉默。囚犯可以做出如下选择：1、供出他的同伙(即与警察合作，从而背叛他的同伙)，2、保持沉默(也就是与他的同伙合作，而不是与警察合作)。这两个囚犯都知道，如果他俩都能保持沉默的话，就都会被释放，因为只要他们拒不承认，警方无法给他们定罪。但警方也明白这一点，所以他们就给了这两个囚犯一点儿刺激：如果他们中的一个人背叛，即告发他的同伙，那么他就可以被无罪释放，同时还可以得到一笔奖金。而他的同伙就会被按照最重的罪来判决，并且为了加重惩罚，还要对他施以罚款，作为对告发者的奖赏。当然，如果这两个囚犯互相背叛的话，两个人都会被按照最重的罪来判决，谁也不会得到奖赏。那么，这两个囚犯该怎么办呢？是选择互相合作还是互相背叛？从表面上看，他们应该互相合作，保持沉默，因为这样他们俩都能得到最好的结果：自由。但他们不得不仔细考虑对方可能采取什么选择。

A犯不是个傻子，他马上意识到，他根本无法相信他的同伙不会向警方提供对他不利的证据，然后带着一笔丰厚的奖赏出狱而去，让他独自坐牢。这种想法的诱惑力实在太大了。但他也意识到，他的同伙也不是傻子，也会这样来设想他。所以A犯的结论是，唯一理性的选择就是背叛同伙，把一切都告诉警方，因为如果他的同伙笨得只会保持沉默，那么他就会是那个带奖出狱的幸运者了。而如果他的同伙也根据这个逻辑向警方交代了，那么，A犯反正也得服刑，起码他不必在这之上再被罚款。所以其结果就是，这两个囚犯按照不顾一切的逻辑得到了最糟糕的报应：坐牢。囚徒困境模型的几个现实例子囚徒困境的例子在现实生活中很多。比如国家与国家之间的军备竞赛，显然，各国都不把大量的财富花在可能永远都用不上的军备上是最佳选择。可是，如果别的国家不把钱花在军备上，我们花，那么我们会在两国外交和贸易中占得优势，拥有国际影响力，在未来战争中赢得胜利。如果别国把钱花在军备上，我们也花，那么我们至少可以不吃亏。所以，不管别的国家把钱花不花在军备上，我们把大把大把的钱花在军备上都是优势选择。所以，我们会把钱花在军备上。显然，别国也会这样想。结果是各国都会把大把大把的钱花在军备上，而且还互相攀比，想要胜过对方，占得优势，以便给对方造成压力。这就造成了军备竞赛，你花一百亿，我花一百五十亿。你花一百五十亿啊，那么我花两

囚徒两难困境启示

囚徒两难困境启示 “囚徒困境”说的是两个囚犯的故事。这两个囚徒一起做坏事，结果被警察发现抓了起来，分别关在两个独立的不能互通信息的牢房里进行审讯。在这种情形下，两个囚犯都可以做出自己的选择：或者供出他的同伙（即与警察合作，从而背叛他的同伙），或者保持沉默（也就是与他的同伙合作，而不是与警察合作）。这两个囚犯都知道，如果他俩都能保持沉默的话，就都会被释放，因为只要他们拒不承认，警方无法给他们定罪。但警方也明白这一点，所以他们就给了这两个囚犯一点儿刺激：如果他们中的一个人背叛，即告发他的同伙，那么他就可以被无罪释放，同时还可以得到一笔奖金。而他的同伙就会被按照最重的罪来判决，并且为了加重惩罚，还要对他施以罚款，作为对告发者的奖赏。当然，如果这两个囚犯互相背叛的话，两个人都会被按照最重的罪来判决，谁也不会得到奖赏。那么，这两个囚犯该怎么办呢？是选择互相合作还是互相背叛？从表面上看，他们应该互相合作，保持沉默，因为这样他们俩都能得到最好的结果：自由。但他们不得不仔细考虑对方可能采取什么选择。A犯不是个傻子，他马上意识到，他根本无法相信他的同伙不会向警方提供对他不利的证据，然后带着一笔丰厚的奖赏出狱而去，让他独自坐牢。这种想法的诱惑力实在太大了。但他也意识到，他的同伙也不是傻子，也会这样来设想他。所以A犯的结论是，唯一理性的选择就是背叛同伙，把一切都告诉警方，因为如果他的同伙笨得只会保持沉默，那么他就会是那个带奖出狱的幸运者了。而如果他的同伙也根

据这个逻辑向警方交代了，那么，A犯反正也得服刑，起码他不必在这之上再被罚款。所以其结果就是，这两个囚犯按照不顾一切的逻辑得到了最糟糕的报应：坐牢。当然，在现实世界里，信任与合作很少达到如此两难的境地。谈判、人际关系、强制性的合同和其他许多因素左右了当事人的决定。但囚徒的两难境地确实抓住了不信任和需要相互防范背叛这种真实的一面。博弈，讲的是多人决策的策略问题。囚徒困境的故事提示我们，参与决策的多方最好保持合作的状态，各方所得利益的总和方可最大化。然而现实生活中背叛所带来的诱惑虽然很大，但结果不总是尽人意的。故事中参与决策的两个囚徒，被警察隔离开了，无法沟通。现实生活中，被隔离而无法沟通的现象的确也有，但更多的是因时间或地域问题决策各方不具备沟通的条件，或者虽有沟通的条件，但决策各方没有彼此的信任，即便沟通也是一个没有信任的沟通，我们姑且叫它为“假沟通”吧。决策各方在不具备沟通条件或者难以建立具备信任的沟通时，各方就会在决策中追求个人或者单方面利益的最大化。就像上面所说的，没有互信，即便具备沟通的条件，也是没有意义的。如何建立互信？在合作过程中，各方有猜疑心里也不为怪，至于彼此是否有诚意合作而不是尔虞我诈，各方都希望是用事实说话。现实社会中，很多这种多方决策的问题不是一次性的，参与决策

囚徒困境的生活实例分析教学资料

囚徒困境的生活实例分析

囚徒困境的生活实例分析中南财经政法大学工商管理学院博弈论对人的基本假定是：人是理性的,理性的人是指他在具体策略选择时的目的是使自己的利益最大化，博弈论研究的是理性的人之间如何进行策略选择的。 “囚徒困境”是博弈论里最经典的例子之一。讲的是两个嫌疑犯（Ａ和Ｂ）作案后被警察抓住，隔离审讯；警方的政策是"坦白从宽，抗拒从严"，如果两人都坦白则各判８年；如果一人坦白另一人不坦白，坦白的放出去，不坦白的判１０年；如果都不坦白则因证据不足各判１年。问题可以总结为：在这个例子里，博弈的参加者就是两个嫌疑犯Ａ和Ｂ，他们每个人都有两个策略即坦白和不坦白，判刑的年数就是他们的支付。可能出现的四种情况：Ａ和Ｂ均坦白或均不坦白、Ａ坦白Ｂ不坦白或者Ｂ坦白Ａ不坦白，是博弈的结果。Ａ和Ｂ均坦白是这个博弈的纳什均衡。这是因为，假定Ａ选择坦白的话，Ｂ最好是选择坦白，因为Ｂ坦白判８年而抵赖却要判十年；假定Ａ选择抵赖的话，Ｂ最好还是选择坦白，因为Ｂ坦白判不被判刑而抵赖确要被判刑１年。即是说，不管Ａ坦白或抵赖，Ｂ的最佳选择都是坦白。反过来，同样地，不管Ｂ是坦白还是抵赖，Ａ的最佳选择也是坦白。结果，两个人都选择了坦白，各判刑８年。在（坦白、坦白）这个组合中，Ａ和Ｂ都不能通过单方面的改变行动增加自己的收益，于是谁也没有动力游离这个组合，因此这个组合是纳什均衡。囚徒困境反映了个人理性和集体理性的矛盾。如果Ａ和Ｂ都选择抵赖，

各判刑１年，显然比都选择坦白各判刑８年好得多。当然，Ａ和Ｂ可以在被警察抓到之前订立一个"攻守同盟"，但是这可能不会有用，因为它不构成纳什均衡，没有人有积极性遵守这个协定。从自私自利的角度出发，选择认罪是最好的这种说法是有缺陷的，因为两个人都可能会得到8年的监禁期。即使是最狡猾的方法也不能把你救出监狱。但是如果你期望你的同伙与你合作，那你最好的选择将是认罪。然而，如果你的同伙知道了你的计划，他也会认罪，此时最好的方法是你们两个合作。这就是这个悖论的关键所在。如果从整体来看，对于两个囚犯而言，最好的结果是两人合作，其它的任何选择都是不好的。实例分析 1：一．电信价格竞争根据我国电信业的实际情况，我们来构造电信业价格战的博弈模型。假设此博弈的参加者为电信运营商A与B, 他们在电信某一领域展开竞争，一开始的价格都是P0。A（中国电信）是老牌企业，实力雄厚，占据了绝大多数的市场份额；B（中国联通）则刚刚成立不久，翅膀还没有长硬，是政府为了打破垄断鼓励竞争而筹建起来的。正因为B是政府扶植起来鼓励竞争的，所以B得到了政府的一些优惠，其中就有B的价格可以比P0低 10％。这一举动，还不会对A产生多大的影响，因为A的根基实在是太牢固了。在这样的市场分配下，A、B可以达到平衡，但由于B在价格方面的优势，市场份额逐步壮大，到了一定程度，对A造成了影响。这时候，A该怎么做？不妨假定： A降价而B维持，则A获利15，B损失5，整体获利 10；

“囚徒困境”的引申与启示

龙源期刊网 https://www.360docs.net/doc/65347411.html, “囚徒困境”的引申与启示作者：丁华来源：《职业时空》2007年第01期周洋韩雪峰什么是囚徒困境亚当·斯密讲了这样一个故事：有两个因巨额盗窃而正在服刑的囚犯A和B。区检察官c 正在调查一宗悬而未决的银行抢劫案，并且他相信A和B就是罪犯。区检察官c正在计划竞选州长，所以希望A和B认罪，因为这样会在他的记录中增加一项重要的定罪案件。他依靠监狱警卫的帮助，对A和B的牢房进行了突击搜查，发现了隐藏的武器和毒品。他知道可以利用这一信息控告他们犯有藏匿武器与毒品的小罪而使之被判刑，他将A和B隔离起来并分别对他们作出了如下承诺：如果无人坦白银行抢劫，他将以藏匿武器与毒品罪起诉并使两人各被再判2年监禁：如果两人都认罪，则都因银行抢劫罪而被再判5年监禁；如果只有一人坦白并将对方揭发出来，则对坦白者的抢劫银行与藏匿武器与毒品行为不予起诉并释放他，而没有坦白的人则会因抢劫银行与藏匿武器与毒品而被再判20年监禁。那么，这两个囚犯该怎么办呢?从表面上看，他们应该互相合作。如果选择抵赖，他们俩都能得到最好的结果。但他们不得不仔细考虑对方可能采取什么选择。对囚徒困境的引申与分析警惕公权力的滥用。在上边的囚徒困境中，区检察官构造了一种情势，使得个人对自己利益的追求会导致对A和B都不利的结果，两个囚徒都会坦白，从而每个人都达到一个双方都认为是差于双方都不坦白的结果。事实上，检察官所构造的这个困境对A和B的激励是如此的强烈，以至于很容易想象A和B被迫承认抢劫银行，甚至即使他们是清白的。我国“文革” 中坦白从宽、抗拒从严的政策之所以能使一大批人承认自己的“罪行”，其奥妙即在于此。个人理性与集体理性的冲突。囚徒困境反映了一个很深刻的问题，这就是个人理性和集体理性的冲突，即理性人的个人理性行为可能导致集体非理性。很显然，A和B双方都抵赖(各

博弈论经典案例“囚徒困境”以及其拓展

博弈论经典案例“囚徒困境”以及其拓展 05-06-13 10:57 发表于：《没有范的世界》分类：未分类博弈论（game theory）对人的基本假定是：人是理性的（rational，或者说自私的）,理性的人是指他在具体策略选择时的目的是使自己的利益最大化，博弈论研究的是理性的人之间如何进行策略选择的。 “囚徒困境” “囚徒困境”是博弈论里最经典的例子之一。讲的是两个嫌疑犯（Ａ和Ｂ）作案后被警察抓住，隔离审讯；警方的政策是"坦白从宽，抗拒从严"，如果两人都坦白则各判８年；如果一人坦白另一人不坦白，坦白的放出去，不坦白的判１０年；如果都不坦白则因证据不足各判１年。在这个例子里，博弈的参加者就是两个嫌疑犯Ａ和Ｂ，他们每个人都有两个策略即坦白和不坦白，判刑的年数就是他们的支付。可能出现的四种情况：Ａ和Ｂ均坦白或均不坦白、Ａ坦白Ｂ不坦白或者Ｂ坦白Ａ不坦白，是博弈的结果。Ａ和Ｂ均坦白是这个博弈的纳什均衡。这是因为，假定Ａ选择坦白的话，Ｂ最好是选择坦白，因为Ｂ坦白判８年而抵赖却要判十年；假定Ａ选择抵赖的话，Ｂ最好还是选择坦白，因为Ｂ坦白判不被判刑而抵赖确要被判刑１年。即是说，不管Ａ坦白或抵赖，Ｂ的最佳选择都是坦白。反过来，同样地，不管Ｂ是坦白还是抵赖，Ａ的最佳选择也是坦白。结果，两个人都选择了坦白，各判刑８年。在（坦白、坦白）这个组合中，Ａ和Ｂ都不能通过单方面的改变行动增加自己的收益，于是谁也没有动力游离这个组合，因此这个组合是纳什均衡。囚徒困境反映了个人理性和集体理性的矛盾。如果Ａ和Ｂ都选择抵赖，各判刑１年，显然比都选择坦白各判刑８年好得多。当然，Ａ和Ｂ可以在被警察抓到之前订立一个"攻守同盟"，但是这可能不会有用，因为它不构成纳什均衡，没有人有积极性遵守这个协定。在经济学方面的实例: 一．电信价格竞争根据我国电信业的实际情况，我们来构造电信业价格战的博弈模型。假设此博弈的参加者为电信运营商A与B, 他们在电信某一领域展开竞争，一开始的价格都是P0。A（中国电信）是老牌企业，实力雄厚，占据了绝大多数的市场份额；B（中国联通）则刚刚成立不久，翅膀还没有长硬，是政府为了打破垄断鼓励竞争而筹建起来的。正因为B是政府扶植起来鼓励竞争的，所以B得到了政府的一些优惠，其中就有B的价格可以比P0低10％。这一举动，还不会对A产生多大的影响，因为A的根基实在是太牢固了。在这样的市场分配下，A、B可以达到平衡，但由于B在价格方面的优势，市场份额逐步壮大，到了一定程度，对A造成了影响。这时候，A该怎么做？不妨假定： A降价而B维持，则A获利15，B损失5，整体获利10； A维持且B也维持，则A获利5，B获利10，整体获利15；

浅析囚徒困境与纳什均衡

浅析囚徒困境令狐采学囚徒困境是博弈论的非零和博弈中具代表性的例子，指反映个人最佳选择并非团体最佳选择。囚徒困境的经典案例这里不再复述，让我们看一下身边的例子。囚徒困境在生活中最常见的表现就是挤公共汽车。从集体理性的角度来看,按次序上车是最有效率的做法,但是你挤我不挤,我就可能上得慢,所以每个人的最优战略都是挤,结果上车就更慢了。学生也同样遭遇囚徒困境：减轻中小学生过重负担喊了20多年，仅1985年至2000年的15年里，中央就下达“减负令”49次。但实际情况却是学生课业负担不但没减下来，反倒呈现出越演越烈之势，致使学生作业做到深夜、节假日仍然上课、业余时间奔忙于各种补习班等。可见“减负令”难以见效，中小学生课业负担不减反增。又比如近年来炒得火热的楼市——“我没买房，结果房价还是涨了，因为我们无法保证大家都不买房。可是，我错了吗？没有。当初如果我买房了，房价下跌了呢？因为我不能保证大家都买房。人们根本不能预知在疾风暴雨式的调控之下，房价竟还能且调且涨。可是，我对了吗？没有。”这是一部眼下流行、充满黑色幽默的网络视频《北漂族的无房生活》中的

经典对白。含泪的“调侃”折射出当下楼市的“囚徒困境”：买，难担高房价重负；不买，难受房价节节攀升的煎熬。再看中国的法治之路。虽然法治让所有人都长期受益，甚至执政者自己也不例外，但是一个狭隘理性社会却偏偏无力支撑法治，以至最后每个理性人都不得不忍受法治缺位的非理性之苦。绝大多数中国人都是很识时务的理性人，不会故意给自己找茬，多数律师也不例外。不过，任何事物都有两面性，“理性”过了头也就成了非理性。这就是充斥着当今中国社会的“囚徒困境”：一种行为模式对于个人看起来是很理性的，但是对于个人构成的集体来说却是非理性的，最后对于每个人来说也是非理性的。我们都不敢站出来说话，对每个人来说都是很“理性”的一种行为方式，但最后的结果只能是让整个社会丧失法治。但囚徒困境一定是坏事吗？就以囚徒困境的经典案例来说，作为一个比喻，我们会为囚犯不能合作而遗憾；可是如果它发生在现实中，我们就巴不得他们不能合作。然而如果是多次博弈，人们就有了合作的可能性，囚徒困境就有可能破解，合作就有可能达成。连续的合作有可能成为重复的囚徒困境的均衡解，这也是博弈论上著名的“大众定理”的含义。但合作的可能性不是必然性。博弈论的研究表明，要想使合作成为多次博弈的均衡解，博弈的一方（最好是实力更强的一方）必须主动通过可信的承诺，向另一方表示合