Chapter 3 of 8
Battle of the Sexes and the Prisoner's Dilemma, the most influential 2x2 games in history
গেম থিওরিতে সবচেয়ে বেশি আলোচিত দুটি গেম হলো ব্যাটল অফ দ্য সেক্সেস এবং প্রিজনার্স ডাইলেমা। এই দুটি গেম প্রায় প্রতিটি গেম থিওরি পাঠ্যবইতে, প্রতিটি আলোচনায়, প্রতিটি প্রাথমিক AI ক্লাসে এবং সহযোগিতা ও দ্বন্দ্ব নিয়ে প্রায় প্রতিটি গুরুত্বপূর্ণ গবেষণাপত্রে দেখা যায়। এগুলো বিখ্যাত কারণ এগুলো বহুলাংশে কৌশলগত জীবনের দুটি গভীরতম উত্তেজনাকে সবচেয়ে ছোট সম্ভাব্য সেটআপে ধারণ করে।
তুমি আর তোমার সঙ্গী শুক্রবার সন্ধ্যার পরিকল্পনা করছো। তুমি বন্ধুর বাসায় ফুটবল ম্যাচ দেখতে চাও; তোমার সঙ্গী অপেরা রেসিটালে যেতে চায়। তোমরা দুজনেই একসাথে যেকোনো কিছু করতে চাও, একা একা নিজেদের পছন্দের জিনিস করার চেয়ে বেশি। কিন্তু অপেরা ও ফুটবল ভিন্ন ভেন্যুতে, মাইল দূরে। ফোন ডেড। তোমাকে দুটি অবস্থানের একটিতে কমিট করতে হবে, জেনে যে তোমার সঙ্গীও তাই করছে। তুমি একই জায়গায় সমন্বয় করতে চাও, কিন্তু ব্যক্তিগত পছন্দও আছে। এটাই ব্যাটল অফ দ্য সেক্সেস।
দুই সন্দেহভাজনকে একটি গুরুতর অপরাধে গ্রেপ্তার করা হয়েছে। পুলিশ তাদের আলাদা করে এবং প্রত্যেককে একই চুক্তি দেয়: যদি তুমি স্বীকার করো এবং তোমার সঙ্গী চুপ থাকে, তুমি মুক্তি পাবে এবং তোমার সঙ্গী দশ বছর কারাদণ্ড পাবে। যদি তোমরা দুজনেই স্বীকার করো, প্রত্যেকে পাঁচ বছর পাবে। যদি তোমরা দুজনেই চুপ থাকো, আমরা কেবল মাইনর অপরাধে তোমাদের ধরতে পারি — এক বছর করে। দুই বন্দীই স্মার্ট, দুজনেই অন্যজনের প্রণোদনা জানে, এবং তারা যোগাযোগ করতে পারে না।
প্রতিটি বন্দী যুক্তি দেয়: "যদি আমার সঙ্গী স্বীকার করে, আমারও স্বীকার করা উচিত — এটা আমাকে দশ বছর থেকে বাঁচায়। আমার সঙ্গী চুপ থাকলে, আমার এখনও স্বীকার করা উচিত — এটা আমাকে মুক্ত করে। তাই আমার সঙ্গী যাই করুক, স্বীকার করা ভালো।" দুজনেই স্বীকার করে, দুজনেই পাঁচ বছর পায়। কিন্তু তারা যদি দুজনেই চুপ থাকতো, দুজনেই এক বছরে বের হয়ে যেত। ব্যক্তিগতভাবে যুক্তিসঙ্গত খেলা একটি সম্মিলিতভাবে খারাপ ফলাফল তৈরি করে। এটাই প্রিজনার্স ডাইলেমা।
আদর্শ পেওয়াফ ম্যাট্রিক্স (A সারি বাছাই করে, B কলাম বাছাই করে):
| B: অপেরা | B: ফুটবল | |
|---|---|---|
| A: অপেরা | (3, 2) | (0, 0) |
| A: ফুটবল | (0, 0) | (2, 3) |
সংখ্যাগুলো একসাথে দুটি তথ্য এনকোড করে:
দুটি ঘর যেখানে দুই খেলোয়াড় একসাথে বেস্ট রেসপন্স করছে:
এই দুটি হলো বিশুদ্ধ-কৌশল ন্যাশ ইকুইলিব্রিয়াম।
A-এর জন্য: অপেরা B-এর অপেরায় 3 দেয়, কিন্তু B-এর ফুটবলে 0 দেয়। ফুটবল অপেরায় 0 দেয়, ফুটবলে 2 দেয়। কোনোটিই সবসময় ভালো নয়। A-এর জন্য কোনো ডমিন্যান্ট স্ট্র্যাটেজি নেই। B-এর জন্যও একই কথা।
দুটি ইকুইলিব্রিয়ামকে দুটি পাহাড়ের চূড়া হিসেবে কল্পনা করো, মাঝখানে একটি উপত্যকা। উভয় খেলোয়াড়ই কোনো না কোনো চূড়ায় উঠতে চায়, কিন্তু তারা ভিন্ন পাহাড় পছন্দ করে। একটিতে বিশুদ্ধ সমন্বয় স্থিতিশীল; অন্যটিতেও স্থিতিশীল; কিন্তু খেলোয়াড়দের কাছে কোন পাহাড়ে উঠবে তা সম্মত হওয়ার কোনো অন্তর্নির্মিত উপায় নেই।
ক্লাসিক পেওয়াফ ম্যাট্রিক্স:
| B: সহযোগিতা | B: বিশ্বাসঘাতকতা | |
|---|---|---|
| A: সহযোগিতা | (3, 3) | (0, 5) |
| A: বিশ্বাসঘাতকতা | (5, 0) | (1, 1) |
চারটি পেওয়াফ লেবেল সাহিত্যে সর্বজনীন:
এটা সত্যিকারের প্রিজনার্স ডাইলেমা হতে হলে পেওয়াফগুলো অবশ্যই T > R > P > S পূরণ করতে হবে। এখানে: 5 > 3 > 1 > 0। ✓
A-এর জন্য: সহযোগিতা B-এর সহযোগিতায় 3 দেয়, B-এর বিশ্বাসঘাতকতায় 0 দেয়। বিশ্বাসঘাতকতা B-এর সহযোগিতায় 5 দেয়, B-এর বিশ্বাসঘাতকতায় 1 দেয়। বিশ্বাসঘাতকতা উভয় কলামেই কঠোরভাবে ভালো। তাই বিশ্বাসঘাতকতা সহযোগিতাকে কঠোরভাবে ডমিনেট করে A-এর জন্য। সামঞ্জস্যতা অনুসারে B-এর জন্যও একই কথা।
যেহেতু বিশ্বাসঘাতকতা দুজনের জন্যই কঠোরভাবে ডমিন্যান্ট, (D, D) হলো একমাত্র ডমিন্যান্ট স্ট্র্যাটেজি ইকুইলিব্রিয়াম। এটি একমাত্র ন্যাশ ইকুইলিব্রিয়ামও, কারণ এমন একটি গেমে যেখানে প্রতিটি খেলোয়াড়ের কঠোরভাবে ডমিন্যান্ট কৌশল আছে, একমাত্র ইকুইলিব্রিয়াম হলো DSE।
আবার চারটি পেওয়াফ দেখো। (C, C) দুই খেলোয়াড়কে 3 দেয়। (D, D) দুজনকে 1 দেয়। উভয় খেলোয়াড়ই একমাত্র ইকুইলিব্রিয়ামে গেমের আরেকটি ফলাফলের চেয়ে কঠোরভাবে খারাপ অবস্থায় আছে।
একটি প্যারেটো-সর্বোত্তম ফলাফল হলো এমন যেখানে অন্য কোনো ফলাফল সবাইকে আরও ভালো করে না। (C, C) প্যারেটো-সর্বোত্তম। (D, D) নয় — উভয় খেলোয়াড়ই (C, C) পছন্দ করবে। কিন্তু (D, D) এখনও ন্যাশ ইকুইলিব্রিয়াম, কারণ (D, D) থেকে (C, C)-তে যেতে হলে উভয় খেলোয়াড়কে একসাথে পরিবর্তন করতে হবে, এবং একতরফা পরিবর্তন বিচ্যুতকারীকে আরও খারাপ করে। ন্যাশ ইকুইলিব্রিয়াম প্যারেটো-অদক্ষ হতে পারে।
নিজের ২×২ গেম তৈরি করতে ঘরগুলো এডিট করো। এক্সপ্লোরার বেস্ট রেসপন্স, ডমিন্যান্ট কৌশল, বিশুদ্ধ-কৌশল ন্যাশ ইকুইলিব্রিয়াম এবং (যখন বিদ্যমান) মিশ্র-কৌশল ন্যাশ ইকুইলিব্রিয়াম গণনা করে — কী পরিবর্তন হয় তা দেখতে প্রতিটি প্রিসেট চেষ্টা করো।
Both prefer to coordinate; Row prefers Up, Col prefers Right.
| Col: Left | Col: Right | |
|---|---|---|
| Row: Up | ||
| Row: Down |
Each cell shows Row payoff (top) and Col payoff (bottom).
Pure-Strategy Nash Equilibria
A cell is a PSNE when Row is best-responding to Col's choice and vice versa.
Dominant Strategies
Row: none
Col: none
Strict dominance beats the other against every column (or row). Weak dominance allows ties.
Best Responses
If Col plays Left → Row best: Up (payoff 3)
If Col plays Right → Row best: Down (payoff 2)
If Row plays Up → Col best: Left (payoff 2)
If Row plays Down → Col best: Right (payoff 3)
Mixed-Strategy Nash Equilibrium
Row plays Up with prob 0.600
Col plays Left with prob 0.400
Expected payoff: 1.200
Indifference: at these mixes each pure action gives the same expected payoff, so the player is willing to randomize.
Cell shading: pure NE · Row's best response only · Col's best response only · no shading → neither player's best response.
পরবর্তী অধ্যায় ডমিন্যান্স ধারণাটিকেই পরিশীলিত করে। আমরা কঠোর ডমিন্যান্স (প্রতিটি ক্ষেত্রে কঠোরভাবে ভালো) আলাদা করব দুর্বল ডমিন্যান্স থেকে (কোথাও খারাপ নয়, অন্তত একটি ক্ষেত্রে কঠোরভাবে ভালো), এবং দেখব কখন কোনো কৌশলই ডমিনেট করে না — ম্যাচিং পেনিজের প্রথম দেখা, সাহিত্যের সবচেয়ে সহজ শূন্য-সমষ্টি গেম।