Chapter 7 of 7
When one random variable isn't the whole story — reasoning about several at once
এতদিন যত চ্যাপ্টার পড়েছো, সবগুলোতেই একটা সময়ে একটা random variable নিয়ে কাজ হয়েছে — একটা PMF, একটা PDF, একটা mean, একটা variance। কিন্তু বাস্তব জগতে একটামাত্র মাপ থেকে খুব একটা কাজের জিনিস বের হয় না। একজন রোগীর blood pressure আছে, cholesterol আছে, বয়স আছে। একটা বাড়ির স্কয়ার ফুটেজ আছে, লোকেশন আছে, বেডরুমের সংখ্যা আছে। একটা মডেলের ইনপুট কখনোই একটা সংখ্যা না — পুরো একটা রো, অনেকগুলো ফিচার নিয়ে। Multivariate probability হলো এই সাবজেক্টের সেই শাখা, যেখানে একাধিক random variable একসাথে, একই স্যাম্পল স্পেসে, একই সময়ে স্টাডি করা হয়।
Multivariate probability একটা ধারালো প্রশ্ন করে — শুধু " হওয়ার সম্ভাবনা কত?" না, বরং " এবং এবং — এই সবগুলো একসাথে হওয়ার সম্ভাবনা কত, যেখানে এই ভ্যারিয়েবলগুলো একে অপরকে প্রভাবিত করতে পারে?" যেই মুহূর্তে তোমার কাছে একই র্যান্ডম এক্সপেরিমেন্ট থেকে আসা দুই বা তার বেশি random variable থাকে, তুমি multivariate টেরিটরিতে ঢুকে গেছো।
random variables চ্যাপ্টার থেকে মনে করো — একটা random variable হলো একটা ফাংশন, যা র্যান্ডম এক্সপেরিমেন্টের আউটকামকে সংখ্যায় ম্যাপ করে। একই এক্সপেরিমেন্টের ওপর তুমি চাইলে একাধিক এমন ফাংশন ডিফাইন করতে পারো। দুইটা ডাইস রোল করো: = প্রথম ডাইসের মান, = দ্বিতীয় ডাইসের মান। একজন কাস্টমারের সার্ভে নাও: = তার বয়স, = মাসিক খরচ, = সে churn করেছে কিনা। প্রতিটা ভ্যারিয়েবলেরই আলাদা আলাদা PMF বা PDF আছে — কিন্তু একবার এগুলোকে একে অপরের সাথে ইন্টারঅ্যাক্ট করতে দিলে, সেটাই পুরো ছবি না।
এখানেই আসল নতুন জিনিসটা — শুধু "একই কনসেপ্ট দুইবার" না। Random variableগুলো একে অপরের সাথে সম্পর্কিত হতে পারে। জানা থাকলে তোমার সম্পর্কে ধারণা বদলে যেতে পারে। লম্বা মানুষ ভারীও হওয়ার সম্ভাবনা বেশি। যে কাস্টমার প্ল্যাটফর্মে বেশিদিন ধরে আছে, তার এই মাসে churn করার সম্ভাবনা কম। আর -কে আলাদা আলাদা স্টাডি করলে ঠিক এই তথ্যটাই হারিয়ে যায় — তাদের মধ্যেকার সম্পর্কটা, যেটা প্রায়ই পুরো ডেটাসেটের সবচেয়ে দরকারি জিনিস।
Multivariate probability তোমাকে শুধু প্রতিটা ভ্যারিয়েবল একা একা কী করে সেটাই বলে না, বরং ভ্যারিয়েবলগুলো একসাথে কীভাবে বদলায় সেটাও বলে দেয় — আর "একসাথে বদলানো"-ই হলো সেই জায়গা যেখানে prediction, correlation, আর মেশিন লার্নিং-এর বেশিরভাগটাই আসলে থাকে।
| Univariate | Multivariate | |
|---|---|---|
| Random variable সংখ্যা | একটা | একই এক্সপেরিমেন্টে দুই বা তার বেশি |
| মূল অবজেক্ট | PMF অথবা PDF | Joint PMF অথবা joint PDF |
| কী উত্তর দিতে পারে | "X = x হওয়ার সম্ভাবনা কত?" | "X = x আর Y = y একসাথে হওয়ার সম্ভাবনা কত?" আর "X জানলে Y সম্পর্কে ধারণা বদলায় কিনা?" |
| ভ্যারিয়েবলদের মধ্যে সম্পর্ক ধরতে পারে? | না — একটাই তো ভ্যারিয়েবল | হ্যাঁ — joint distribution-এর কাজই এটা |
এটা "আসল ML কনটেন্ট"-এ যাওয়ার আগের একটা অ্যাকাডেমিক ডিটোর না — এটাই আসল ML কনটেন্ট। একটা ডেটাসেটের রোগুলো তার কলামগুলোর (ফিচার, আর প্রায়ই টার্গেটও) ওপর একটা joint distribution থেকে নেওয়া স্যাম্পল। ফিচার কোরিলেশন, Naive Bayes-এর পেছনের অ্যাসাম্পশন, generative আর discriminative মডেলের পার্থক্য, Gaussian Mixture Models-এর পেছনের multivariate Gaussian — এসবকিছুই সরাসরি এই চ্যাপ্টারের আইডিয়ার ওপর দাঁড়িয়ে। চ্যাপ্টার শেষে তুমি একটা ফিচার ম্যাট্রিক্সকে আর স্প্রেডশিট হিসেবে দেখবে না, বরং কোনো একটা আন্ডারলাইং joint distribution থেকে আসা স্যাম্পল হিসেবে দেখবে — ঠিক যেভাবে সেই ডেটা ব্যবহার করা মডেলগুলোও ডেটাটা "দেখে"।
Joint Distribution কী? দুইটা (বা তার বেশি) random variable-এর joint distribution হলো একটা সিঙ্গেল অবজেক্ট, যেটা তাদের সম্ভাব্য প্রতিটা কম্বিনেশন-এর সম্ভাবনা একসাথে বলে দেয় — আলাদা আলাদা আচরণ না, বরং তাদের একসাথে আচরণ।
Joint Probability. — পড়ো "X সমান x এবং Y সমান y হওয়ার সম্ভাবনা" — এটাই joint probability। কমা মানে "এবং": এই আউটকাম গণনা হতে হলে দুইটা ঘটনাই একসাথে ঘটতে হবে।
দুইটা Random Variable X আর Y. সবচেয়ে সহজ আর সবচেয়ে কমন কেস হলো ঠিক দুইটা random variable। এই চ্যাপ্টারের সেকশন ২–১১ পুরোটাই প্রথমে একটা জোড়া -এর ওপর বানানো হবে, তারপর সেকশন ১২-এ তিন বা তার বেশি ভ্যারিয়েবলে জেনারেলাইজ করা হবে — দুই-ভ্যারিয়েবল কেসটাই প্রায় সবটা ইনটুইশন বহন করে, বাড়তি ভ্যারিয়েবলগুলো মূলত বাড়তি হিসাব যোগ করে, নতুন আইডিয়া না।
একাধিক Variable-এর Joint Distribution. ডেফিনিশনে দুইয়ে থেমে যাওয়ার কোনো বাধ্যবাধকতা নেই। তুমি চাইলে -এর joint distribution নিয়েও কথা বলতে পারো, বা পুরো একটা ফিচার ভেক্টর নিয়েও — একই মূল আইডিয়া (প্রতিটা কম্বিনেশনে একটা probability বা density) সরাসরি স্কেল আপ হয়ে যায়।
Joint PMF বনাম Joint PDF. সিঙ্গেল-ভ্যারিয়েবল distribution যেমন discrete (PMF) আর continuous (PDF) কেসে ভাগ হয়, joint distribution-ও তেমনি ভাগ হয় — আর কোনটা প্রযোজ্য হবে সেটা নির্ভর করে ভ্যারিয়েবলগুলো নিজেই discrete না continuous, ঠিক যেভাবে random variables চ্যাপ্টারে দেখেছিলে।
| Joint PMF | Joint PDF | |
|---|---|---|
| ভ্যারিয়েবল টাইপ | X আর Y দুইটাই discrete | X আর Y দুইটাই continuous |
| নোটেশন | ||
| সরাসরি কী দেয় | একটা আসল probability | একটা density — শুধু এর নিচের area/volume-ই probability |
| কীসের সমষ্টি/ইন্টিগ্রাল ১ হতে হয় | সব জোড়ার ওপর ১ | পুরো প্লেনের ওপর ১ |
Discrete Random Variable-এর Joint PMF. যখন আর দুইটাই discrete, তাদের joint probability mass function:
যেখানে: প্রতিটা সম্ভাব্য জোড়া -এর জন্য, হলো -এর মান হওয়ার সম্ভাবনা এবং, ঠিক সেই একই আউটকামে, -এর মান হওয়ার সম্ভাবনা — প্রতিটা কম্বিনেশনের জন্য একটা সংখ্যা, প্রতিটা ভ্যারিয়েবলের জন্য না।
Joint Probability Table. Discrete ভ্যারিয়েবলের ক্ষেত্রে joint PMF সাজানোর সবচেয়ে স্বাভাবিক উপায় একটা টেবিল — রো-তে -এর মান, কলামে -এর মান, আর প্রতিটা সেলে ।
হিসাব করা উদাহরণ। একটা fair চার-পাশের ডাইস দুইবার রোল করো; = প্রথম রোলের ফলাফল (ছোট টেবিলের জন্য -তে সীমাবদ্ধ) আর = দ্বিতীয় রোল জোড় () না বিজোড় (), ধরো joint PMF এরকম:
| Y = 0 (বিজোড়) | Y = 1 (জোড়) | |
|---|---|---|
| X = 1 | 0.25 | 0.25 |
| X = 2 | 0.25 | 0.25 |
Joint PMF-এর বৈশিষ্ট্য।
| বৈশিষ্ট্য | স্টেটমেন্ট | কেন |
|---|---|---|
| Non-negativity | প্রতিটা জোড়ার জন্য | একটা probability কখনো নেগেটিভ হতে পারে না |
| মোট probability | সম্ভাব্য প্রতিটা আউটকাম-জোড়া মিলে সব probability-টা কভার করতে হবে | |
| সীমাবদ্ধ | সিঙ্গেল-ভ্যারিয়েবল PMF-এর একই লজিক, শুধু একটা জোড়ার ওপর প্রয়োগ করা |
Joint PMF থেকে Probability হিসাব করা। আর দিয়ে বানানো যেকোনো ইভেন্টের probability বের করতে, সেই ইভেন্ট সন্তুষ্ট করে এমন প্রতিটা জোড়ার যোগ করো। ওপরের টেবিল থেকে, , আর সরাসরি টেবিল থেকে।
Continuous Random Variable-এর Joint PDF. যখন আর দুইটাই continuous, তখন এক্স্যাক্ট probability-র কোনো টেবিল নেই (যেকোনো একটা নির্দিষ্ট জোড়া -এর probability ঠিক 0, একই কারণে যেভাবে একটামাত্র continuous -এর একটা পয়েন্টের probability 0 হয়)। এর বদলে একটা joint probability density function থাকে।
যেখানে: নিজে কোনো probability না — এটা একটা density। প্লেনের কোনো একটা রিজিয়ন -তে পড়ার probability হলো সারফেস -এর নিচে, রিজিয়ন -এর ওপরে আটকে থাকা volume।
Probability হিসেবে Area/Volume. এটা সিঙ্গেল-ভ্যারিয়েবল PDF-এর "curve-এর নিচের area-ই probability" আইডিয়ার সরাসরি 2D ভার্সন। একটা ভ্যারিয়েবলের জন্য, probability ছিল একটা লাইনের ওপর কোনো ইন্টারভালে curve-এর নিচের area। দুইটা ভ্যারিয়েবলের জন্য, probability হলো একটা প্লেনের রিজিয়নের ওপর surface-এর নিচের volume।
Joint PDF-এর বৈশিষ্ট্য।
| বৈশিষ্ট্য | স্টেটমেন্ট | কেন |
|---|---|---|
| Non-negativity | সবখানে | একটা density কখনো নেগেটিভ হতে পারে না, যদিও এটা 1-এর বেশি হতে পারে |
| মোট volume | পুরো প্লেনের ওপর পুরো সারফেসকে ঠিক 1 ইউনিট মোট probability আটকাতে হবে |
Region-এর ওপর Probability হিসাব করা। হিসাব করা উদাহরণ: ধরো , -এর জন্য (বাকি সব জায়গায় 0)। ভ্যালিড কিনা চেক করো: । বের করতে, শুধু সেই ছোট বর্গের ওপর ইন্টিগ্রেট করো: — প্লেন রিজিয়নের চার ভাগের এক ভাগ, কিন্তু probability-র চার ভাগের এক ভাগের চেয়ে লক্ষণীয়ভাবে কম, কারণ অরিজিনের কাছে -এর কাছের চেয়ে ছোট।
দুইটা random variable X আর Y-এর joint PMF টেবিল সরাসরি এডিট করো। টেবিলের সেল বদলানোর সাথে সাথে marginals, covariance, correlation, আর independence চেক — সব একসাথে বদলাতে দেখো।
X and Y were generated with no relationship to each other. Edit any cell weight to explore other joint distributions.
Joint PMF — P(X = x, Y = y)
| X \ Y | 0 | 1 | P(X=x) |
|---|---|---|---|
| 0 | 0.150 | 0.100 | 0.250 |
| 1 | 0.300 | 0.200 | 0.500 |
| 2 | 0.150 | 0.100 | 0.250 |
| P(Y=y) | 0.600 | 0.400 | 1.000 |
Row X = 0
Row X = 1
Row X = 2
Conditional PMF — P(Y = y | X = x)
Y = 0
0.600
Y = 1
0.400
E[X]
1.000
E[Y]
0.400
Cov(X,Y)
0.000
Correlation
0.000
টেবিলের একটা সেল বদলিয়ে দেখো — রো আর কলাম দুইটার marginal totalই কীভাবে বদলে যায়। এই মেকানিজমটাই সেকশন ৩-এ পরে ফর্মাল করা হবে।
সংজ্ঞা। একটা marginal distribution হলো শুধু একটা ভ্যারিয়েবলের নিজস্ব distribution, যেটা joint distribution থেকে বের করা হয় অন্য ভ্যারিয়েবল(গুলো)-র সম্ভাব্য প্রতিটা মান হিসাবে নিয়ে। মানে কী করেছে সেটা নিয়ে আর মাথা না ঘামিয়ে, শুধু -কে আবার একা একা জিজ্ঞেস করা।
Joint বনাম Marginal Distribution. Joint distribution " এবং " ধরনের প্রশ্নের উত্তর দেয়। Marginal distribution সাধারণ "" প্রশ্নের উত্তর দেয় — একই আন্ডারলাইং ডেটা, শুধু আলাদা প্রশ্ন করা হচ্ছে।
Marginalization কেন দরকার। বাস্তবে প্রায়ই তোমার হাতে একটা joint distribution থাকে (একটা joint PMF টেবিল, বা একটা ফিট করা joint PDF) কিন্তু তুমি আসলে শুধু একটা ভ্যারিয়েবলের নিজস্ব আচরণ জানতে চাও — তার নিজের mean, তার নিজের শেপ, তার নিজের রিস্ক। Marginalization হলো ঠিক সেই নিয়ম, যেটা "সবকিছু, একসাথে" থেকে "শুধু এই একটা ভ্যারিয়েবল, একা" — কোনো তথ্য না হারিয়ে, ডাবল-কাউন্ট না করে ফিরে যায়।
X-এর Marginal PMF. Joint PMF-কে -এর প্রতিটা মানের ওপর যোগ করো:
যেখানে: -এর নিজস্ব probability মান নেওয়ার জন্য, সেই রো-এর প্রতিটা joint সেল যোগ করো ( থাকা অবস্থায় যেভাবেই হোক না কেন) — যেহেতু -এর মান অনুযায়ী এই আউটকামগুলো পরস্পর exclusive, এগুলো যোগ করা ঠিক আছে। একই লজিক, রো-এর বদলে কলামের ওপর যোগ করলে, -এর marginal দেয়।
Random Variable-কে Sum করে বাদ দেওয়া। "Marginal" নামটা এসেছে এই রো/কলাম টোটালগুলো একটা joint probability টেবিলের আক্ষরিক মার্জিনে (কিনারায়) লেখার অভ্যাস থেকে — নামটা আসলে সংখ্যাগুলো পেজে কোথায় বসে সেটারই বর্ণনা।
উদাহরণ। সেকশন ২.২-এর joint টেবিল ব্যবহার করে:
| Y = 0 | Y = 1 | X-এর Marginal | |
|---|---|---|---|
| X = 1 | 0.25 | 0.25 | |
| X = 2 | 0.25 | 0.25 | |
| Y-এর Marginal | মোট = 1 |
X-এর Marginal PDF. Joint PDF-কে -এর প্রতিটা মানের ওপর ইন্টিগ্রেট করো — sum-এর ঠিক continuous ভার্সন:
যেখানে: একটা নির্দিষ্ট -এর জন্য, -কে সম্ভাব্য প্রতিটা -এর ওপর ইন্টিগ্রেট করলে সারফেসটা -অক্ষের ওপর সংকুচিত হয়ে যায় — জ্যামিতিকভাবে, তুমি সারফেসটাকে সেই -এ স্লাইস করে সেই একটা স্লাইসের নিচের area বের করছো।
Random Variable-কে ইন্টিগ্রেট করে বাদ দেওয়া। এটাই "-কে ইন্টিগ্রেট করে বাদ দেওয়া" মানে বাস্তবে: ফলাফল থেকে -নির্ভরতা পুরোপুরি হারিয়ে যায়, শুধু -এর ফাংশন থেকে যায়।
Y-এর Marginal PDF. সিমেট্রিক — -এর বদলে -এর ওপর ইন্টিগ্রেট করো।
উদাহরণ। , -এর ওপর: , -এর জন্য। ভ্যালিড PDF কিনা চেক করো: । সিমেট্রি অনুযায়ী, -ও।
Marginalization
একটা joint distribution থেকে একটা ভ্যারিয়েবলের নিজস্ব distribution বের করার সাধারণ অপারেশন, বাকি ভ্যারিয়েবল(গুলো)-র সব মান হিসাবে নিয়ে।
Sum Rule
Discrete ভার্সন: যে ভ্যারিয়েবল বাদ দিতে চাও, তার ওপর joint PMF যোগ করো। এটাই আক্ষরিকভাবে Law of Total Probability-র পেছনের সেই 'sum rule'।
Continuous Variable-এর জন্য Integration
Continuous ভার্সন: যে ভ্যারিয়েবল বাদ দিতে চাও, তার ওপর joint PDF ইন্টিগ্রেট করো। sum rule-এর একই আইডিয়া, শুধু sum-এর বদলে integral, কারণ ভ্যারিয়েবলটা অসীম সংখ্যক মান নেয়।
আর আলাদা আলাদা জানলেই সাধারণত ফেরত পাওয়া যায় না — অনেক আলাদা joint distribution একই দুইটা marginal শেয়ার করতে পারে (শুধু independence-এর বিশেষ কেসে, সেকশন ৫, marginals থেকেই joint রিকনস্ট্রাক্ট করা যায়, দিয়ে)। বাড়তি তথ্য ছাড়া marginalization শুধু একদিকেই কাজ করে।
Conditional Distribution কী? একটা conditional distribution বর্ণনা করে একটা ভ্যারিয়েবলের আচরণ, যখন তুমি আগে থেকেই জানো অন্য ভ্যারিয়েবলটা কী মান নিয়েছে — joint distribution-কে একটামাত্র "স্লাইস"-এ সংকুচিত করা, ঠিক conditional probability চ্যাপ্টারের সেই একই রেস্ট্রিকশন আইডিয়া, শুধু এবার একটা ইভেন্টের বদলে পুরো একটা distribution-এর ওপর প্রয়োগ করা।
Conditional PMF.
যেখানে: শুধু সেই আউটকামগুলোতে মনোযোগ দাও যেখানে (probability ), তারপর, শুধু সেই স্লাইসের ভেতরে, জিজ্ঞেস করো joint probability কীভাবে -এর সম্ভাব্য মানগুলোর ওপর ছড়িয়ে আছে — দিয়ে ভাগ করলে সেই স্লাইসটা এমনভাবে রিস্কেল হয় যেন সেটা নিজেই একটা ভ্যালিড probability distribution হয়, -এর ওপর যোগফল 1।
Conditional PDF. Density-র জন্য ঠিক একই আইডিয়া:
P(X|Y). -কে প্রায়ই শুধু লেখা হয় — পড়ো "X=x-এর probability, দেওয়া থাকলে Y=y।"
P(Y|X). সিমেট্রিক — রোল বদলাও: ।
হিসাব করা উদাহরণ। সেকশন ২.২-এর টেবিল ব্যবহার করে: । লক্ষ্য করো এটা unconditional -এর সমানও — independence-এর একটা ইঙ্গিত, যা সেকশন ৫-এ ফর্মাল করা হবে।
Joint → Marginal
Joint distribution-কে একটা ভ্যারিয়েবলের ওপর যোগ বা ইন্টিগ্রেট করো (সেকশন ৩) — অন্য ভ্যারিয়েবলের নিজস্ব distribution পাবে।
Joint → Conditional
Joint distribution-কে একটা marginal দিয়ে ভাগ করো (সেকশন ৪.১) — একটা ভ্যারিয়েবলের distribution পাবে, অন্যটার জানা মানে রেস্ট্রিক্টেড।
Marginal + Conditional → Joint
একটা marginal-কে তার সাথে মিলে যাওয়া conditional দিয়ে গুণ করো — joint distribution ঠিক ফিরে পাবে।
যেখানে: এটা কেবল conditional-probability-র সংজ্ঞাটাই পুনর্বিন্যাস করা — একটা conditional distribution-কে সেটা যেটার শর্তে ছিল সেই marginal দিয়ে গুণ করলে ভাগটা বাতিল হয়ে যায় আর অরিজিনাল joint distribution ফেরত আসে। দুইটা ফর্মই সবসময় একসাথে সত্য — এগুলো একই joint probability, শুধু দুইভাবে ফ্যাক্টর করা।
এই একটা আইডেন্টিটিই পুরো চ্যাপ্টারের কব্জা: এটাই কারণ , , আর কখনো তিনটা স্বাধীন তথ্য না — এদের যেকোনো দুইটা জানলেই তৃতীয়টা ঠিক হয়ে যায়।
দুইটা random variable independent হয় যদি একটার মান জানা অন্যটা সম্পর্কে কোনো তথ্য না দেয় — দেওয়া থাকলে -এর conditional distribution ঠিক -এর সাধারণ marginal distribution-এর মতোই, যাই হোক না কেন।
Independent Random Variables. আর independent, ঠিক তখনই যখন:
যেখানে: joint probability ঠিক ঠিক দুই marginal-এর গুণফলে ফ্যাক্টর হয়ে যায়। এটা প্রতিটা জোড়া -এর জন্য সত্য হতে হবে, শুধু কিছুটার জন্য না — একটা মাত্র জোড়া ফেল করলেই ভ্যারিয়েবলগুলো dependent প্রমাণিত হয়ে যায়।
Independent Variable-দের Joint Distribution. আর independent হলে, পুরো joint PMF টেবিল (বা joint PDF সারফেস) শুধু দুই marginal থেকেই রিকনস্ট্রাক্ট করা যায় — প্রতিটা joint সেল তার রো-টোটাল আর কলাম-টোটালের গুণফল। এটাই একমাত্র কেস যেখানে সেকশন ৩-এর "শুধু marginals দিয়ে joint রিবিল্ড করা যায় না" ওয়ার্নিংটা প্রযোজ্য না।
Joint বনাম Marginal Distribution — independence-এর সংযোগ। Independence ঠিক সেই শর্ত, যার অধীনে joint distribution দুই marginal মিলিয়ে যা তথ্য দেয়, তার বেশি কিছু বহন করে না। Dependence ঠিক সেই শর্ত, যার অধীনে এটা বেশি তথ্য বহন করে — সম্পর্কটা নিজেই বাড়তি তথ্য, প্রতিটা ভ্যারিয়েবল একা একা কী করে সেটার ওপরে।
একটা joint PMF টেবিল থেকে দুইটা discrete random variable independent কিনা চেক করতে: প্রতিটা marginal হিসাব করো, তারপর প্রতিটা সেলের জন্য ঠিক আছে কিনা চেক করো। টেবিলের যেকোনো একটা জায়গায় একটা মিসম্যাচ পেলেই dependence প্রমাণিত।
হিসাব করা উদাহরণ — dependent কেস। । Marginals: । সেল চেক করো: । মিলছে না, তাই আর dependent — একবার একটা সেল ফেল করলে আর কোনো সেল চেক করার দরকার নেই।
| Independent | Dependent | |
|---|---|---|
| Joint probability | — সবসময় ফ্যাক্টর হয় | কমপক্ষে একটা জোড়ার জন্য |
| Conditional distribution | প্রতিটা -এর জন্য একই — marginal -এর সমান | বদলালে -ও বদলায় |
| Covariance (সেকশন ৭) | সবসময় ঠিক 0 | 0-না হতে পারে (কিন্তু 0-ও হতে পারে — সেকশন ৭-এর ওয়ার্নিং দেখো) |
| একটা ভ্যারিয়েবল জানা থেকে তথ্য | কিছুই না — Y জানা X সম্পর্কে নতুন কিছু বলে না | কিছুটা — Y জানা X সম্পর্কে ধারণা আপডেট করে |
দুইটা আলাদা fair ডাইস রোল করলে: ডাইস 1 আর ডাইস 2-এর ফলাফল independent — একটার ফিজিক্যাল ফলাফল অন্যটার probability একটুও বদলায় না। এর বিপরীতে ভাবো একটা ডেক থেকে রিপ্লেসমেন্ট ছাড়া দুইটা কার্ড টানা: দ্বিতীয় কার্ডের distribution আসলেই প্রথম কার্ডের ওপর নির্ভর করে (সেই মানের একটা কম কার্ড ডেকে থেকে যায়), তাই এই দুই টান dependent।
দুইটা ভ্যারিয়েবল সামগ্রিকভাবে dependent হয়েও, একটা তৃতীয় ভ্যারিয়েবলের ওপর condition করলে independent হয়ে যেতে পারে — একে বলে conditional independence, লেখা হয় , আর এর মানে । ক্লাসিক উদাহরণ: বাচ্চাদের জুতার সাইজ আর পড়ার দক্ষতা সব বয়সের বাচ্চাদের জনসংখ্যায় কোরিলেটেড — কিন্তু বয়সের ওপর condition করলে, এই কোরিলেশনটা উবে যায় (বড় বাচ্চাদের পা-ও বড়, পড়ার দক্ষতাও বেশি — বয়সটাই দুইটার পেছনের আসল কারণ)। বয়স একটা confounder, আর এর ওপর condition করলে ভুয়া dependence মুছে যায়। এই আইডিয়াটাই Naive Bayes-কে "naive" বানায়: এটা ধরে নেয় যে ক্লাস লেবেল দেওয়া থাকলে ফিচারগুলো conditionally independent — যেটা প্রায় কখনোই ঠিক ঠিক সত্য না, কিন্তু প্রায়ই যথেষ্ট ভালো অ্যাপ্রোক্সিমেশন যা অত্যন্ত কাজের হয়।
Expectation স্বাভাবিকভাবেই দুইটা random variable-এর একসাথে ফাংশনের জন্যও এক্সটেন্ড হয় — — শুধু আর আলাদা আলাদা না।
যেখানে: expectation চ্যাপ্টারের সিঙ্গেল-ভ্যারিয়েবল expectation-এর একই weighted-average প্যাটার্ন, শুধু সিঙ্গেল-ভ্যারিয়েবল probability/density-র বদলে joint probability/density দিয়ে ওজন দেওয়া, আর প্রতিটা জোড়ার ওপর যোগ/ইন্টিগ্রেট করা।
E[X], E[Y]. এগুলো শুধু বিশেষ কেস (বা ): — যেটা সাধারণ সিঙ্গেল-ভ্যারিয়েবল expectation ফর্মুলায় ফিরে যায়, -এর marginal থেকে হিসাব করা, কারণ -এর ওপর প্রথমে যোগ করলেই পুনরুৎপাদন হয়।
E[g(X,Y)]. সবচেয়ে কমন নন-ট্রিভিয়াল কেস হলো , যা দেয় — ঠিক সেই রাশি যেটা থেকে সেকশন ৭-এর covariance ফর্মুলা বানানো।
Linearity (expectation চ্যাপ্টারের সেকশন ২.৪) এখানেও অপরিবর্তিত থাকে, dependence যাই হোক না কেন যেকোনো random variable-এর জন্য: ।
হিসাব করা উদাহরণ। সেকশন ২.২-এর টেবিল ব্যবহার করে: ।
হিসাব করা উদাহরণ। , -এর ওপর: ।
Expectation, Variance & Covariance চ্যাপ্টারে covariance আর correlation পুরোপুরি বানানো হয়েছে (তার সেকশন ৫–৬) — এই সেকশনটা শুধু একটা ছোট, ফোকাসড রিক্যাপ, এগুলো একটা joint distribution-এর ভেতরে ঠিক কীভাবে বসে, কারণ এগুলো সবসময় সেই অবজেক্ট থেকেই হিসাব করা হয়।
যেখানে: , , আর সবগুলোই সেকশন ৬-এর ফর্মুলা থেকে joint distribution দিয়ে হিসাব করা — covariance একটা joint distribution থেকে বের করা সংখ্যা, নতুন কোনো তথ্য দরকার হয় এমন আলাদা অবজেক্ট না।
Covariance-এর ব্যাখ্যা। পজিটিভ মানে আর একসাথে তাদের mean-এর ওপরে থাকার প্রবণতা দেখায়; নেগেটিভ মানে একটা mean-এর ওপরে থাকলে অন্যটা নিচে থাকার প্রবণতা; শূন্য মানে কোনো দিকেই ডিটেক্টেবল লিনিয়ার প্রবণতা নেই (সেকশন ৫-এর independence সংযোগ: independent সবসময় zero covariance ইমপ্লাই করে, কিন্তু উল্টোটা না)।
Correlation Coefficient. — covariance-এর ইউনিটবিহীন, -সীমাবদ্ধ রিস্কেলিং।
Joint Distribution আর Covariance-এর সম্পর্ক। Covariance-এর প্রতিটা উপাদান — , , — সরাসরি joint PMF বা joint PDF থেকে হিসাব করা। Joint distribution বদলালে (এমনকি দুই marginal ঠিক রেখেও, যেটা সম্ভব যখনই independent না), covariance-ও বদলাতে পারে, কারণ covariance নির্ভর করে দুই ভ্যারিয়েবল কীভাবে একসাথে জোড়া লাগানো তার ওপর, শুধু তাদের আলাদা আলাদা marginal আচরণের ওপর না।
ফিচার সম্পর্ক
দুইটা ডেটাসেট কলামের মধ্যে Cov(Xi, Xj) বলে দেয় তারা একসাথে বদলায় কিনা — রিডানডেন্ট বা তথ্যবহুল ফিচার-জোড়া খুঁজে বের করার শুরু।
ফিচার Correlation
মডেলিং-এর আগে correlation ম্যাট্রিক্স একটা স্ট্যান্ডার্ড প্রথম এক্সপ্লোরেটরি স্টেপ, যা প্রায় একই রকম (উচ্চ |ρ|) বা সত্যিকার নতুন তথ্য যোগ করা (কম |ρ|) ফিচার ফ্ল্যাগ করে।
Covariance ম্যাট্রিক্স
পুরো একটা ফিচার ভেক্টরের জন্য, প্রতিটা জোড়া Var/Cov একটা ম্যাট্রিক্স Σ-তে প্যাক করা হয় — PCA, multicollinearity ডায়াগনসিস, আর Gaussian মডেল সবই সরাসরি এর ওপর দাঁড়ানো।
Conditional expectation হলো -এর expected value, তার conditional distribution (সেকশন ৪.১) ব্যবহার করে হিসাব করা, সাধারণ marginal-এর বদলে — -এর গড়, শুধু সেই আউটকামের স্লাইসে সীমাবদ্ধ যেখানে জানা আছে -এর সমান।
যেখানে: গঠনগতভাবে সাধারণ expectation-এর মতোই, কিন্তু প্রতিটা ওজন marginal-এর বদলে conditional PMF/PDF থেকে আসে — -এর "গড়," এবার শুধু সেই জগতে হিসাব করা যেখানে আগে থেকেই সত্য বলে জানা।
E[X|Y]. যখন একটা নির্দিষ্ট মানে ফিক্সড না থেকে ভ্যারিয়েবল হিসেবে থেকে যায়, তখন নিজেই একটা random রাশি হয়ে যায় — যা-ই হোক না কেন, তার একটা ফাংশন। এই অবজেক্টটাই সেকশন ৯–১১-এর নিয়মগুলোর ভিত্তি।
Conditional Mean. -এর আরেক নাম — "-এর mean, সেই জগতে যেখানে ।"
Conditional Variance. স্বাভাবিক variance-সংস্করণ: — -এর spread, এটাও স্লাইসে সীমাবদ্ধ।
ব্যাখ্যা। Conditional expectation উত্তর দেয়: " সম্পর্কে এখন যা জানি, সেই অনুযায়ী -এর জন্য আমার সবচেয়ে ভালো একটামাত্র অনুমান কী?" এটা সাধারণ, unconditional -এর চেয়ে বেশি ইনফরমেটিভ, যখনই আর dependent, কারণ এটা -র সেই বাড়তি তথ্য ব্যবহার করে যা সম্পর্কে বহন করে।
Prediction
টার্গেট অনুমান করতে ইনপুট ফিচার ব্যবহার করা যেকোনো prediction, মূলত একটা conditional expectation হিসাব (বা অ্যাপ্রোক্সিমেট) করার চেষ্টা।
Regression
একটা regression মডেলের আউটপুট ŷ, আইডিয়ালাইজড কেসে, E[Y | X = x]-এর একটা এস্টিমেট — দেওয়া ফিচার অনুযায়ী টার্গেটের conditional mean।
Probabilistic Modeling
'এই ইনপুট দেওয়া থাকলে মডেল কী এক্সপেক্ট করে' — এর পেছনের গাণিতিক অবজেক্টটাই conditional expectation — prediction-এর ইনটুইটিভ আইডিয়ার ফর্মাল ভার্সন।
ধরো -এর সম্ভাব্য মানগুলো sample space-কে ওভারল্যাপ-না-করা কয়েকটা গ্রুপে ভাগ করে দেয় — একটা partition। প্রতিটা আউটকাম ঠিক একটা গ্রুপে পড়ে, সেটা কোন -এর মান দিয়েছে তার ওপর নির্ভর করে।
যেখানে: এটা সেকশন ৩-এর marginalization-ই, শুধু একটা raw joint টেবিলের বদলে conditional probability দিয়ে লেখা — প্রতিটা গ্রুপ -এর জন্য, সেই গ্রুপের ভেতরে -এর probability যোগ করো, সেই গ্রুপ কতটা সম্ভাব্য তার ওজন দিয়ে।
Discrete Case. ঠিক ওপরের sum ফর্ম — যখনই সসীম (বা গণনাযোগ্য) সংখ্যক মান নেয় তখন ব্যবহৃত।
Continuous Case. — একই ওজনযুক্ত-কম্বিনেশন আইডিয়া, discrete গ্রুপের ওপর sum-এর বদলে একটা কন্টিনিউয়ামের ওপর integral।
Conditional Distribution-এর সাথে সংযোগ। এটা ঠিক সেকশন ৪.২-এর "Joint → Marginal" তীর, শুধু -এর ওপর যোগ করার আগে (সেকশন ৪-এর গুরুত্বপূর্ণ সম্পর্ক) বসিয়ে — Law of Total Probability নতুন কোনো ফ্যাক্ট না, এটা সেকশন ৩ আর ৪-কে একটা ফর্মুলায় মিলিয়ে দেওয়া।
একই "গ্রুপে ভাগ করো, গ্রুপ-সাইজ দিয়ে ওজন দিয়ে কম্বাইন করো" লজিক, এবার একটা probability-র বদলে expected value-এর ওপর প্রয়োগ করা।
যেখানে: সামগ্রিক, unconditional হলো প্রতিটা গ্রুপের conditional mean -এর একটা ওজনযুক্ত গড়, প্রতিটা গ্রুপ কতটা সম্ভাব্য তার ওজন দিয়ে।
Conditional Expectation. ঠিক সেকশন ৮-এর অবজেক্টটাই আবার ব্যবহার করা — এই নিয়মটাই conditional expectation-কে -এর পুরো marginal distribution সরাসরি না লিখেও একটা সাধারণ, unconditional expectation হিসাব করার জন্য কাজের বানায়।
Expectation-এর Marginalization. সেকশন ৩ যেমন একটা distribution-কে marginalize করে, এই নিয়মটা একটা expectation-কে marginalize করে — একটা গড়ের গড়, কিন্তু -এর নিজস্ব distribution-এর ওপর।
উদাহরণ। একটা কারখানায় দুইটা মেশিন আছে: মেশিন A ইউনিটের 60% বানায়, প্রতি 100 ইউনিটে গড় 2টা ডিফেক্ট নিয়ে; মেশিন B 40% বানায়, প্রতি 100-এ গড় 5টা ডিফেক্ট নিয়ে। সামগ্রিক গড় ডিফেক্ট রেট: ডিফেক্ট প্রতি 100 ইউনিটে — ঠিক দুই conditional mean-এর একটা ওজনযুক্ত গড়।
একটা গ্রুপিং ভ্যারিয়েবল চালু করলে variance দুইটা আলাদা উৎসে ভাগ হয়ে যায়: প্রতিটা গ্রুপের ভেতরের spread, আর গ্রুপগুলোর নিজস্ব mean-এর মধ্যে spread।
যেখানে: প্রথম টার্মটা প্রতিটা গ্রুপের নিজস্ব ভেতরের spread গড় করে (সেকশন ৮-এর conditional variance); দ্বিতীয় টার্মটা মাপে গ্রুপের mean নিজেরা কতটা গ্রুপ থেকে গ্রুপে বদলায়।
Conditional Variance. সেকশন ৮-এর -ই আবার ব্যবহার করা — "একটা গ্রুপের ভেতরে" অংশটা।
Within-Group Variance (গ্রুপের ভেতরের). যদি প্রতিটা গ্রুপের -এর mean মান একদম নিখুঁতভাবে অনুমান করতেও পারতো, তবুও একটা গ্রুপের ভেতরের আলাদা মানগুলো ছড়িয়ে থাকতে পারে — সেই ছড়ানোটাই within-group টার্ম।
Between-Group Variance (গ্রুপের মধ্যেকার). এমনকি যদি প্রতিটা গ্রুপের ভেতরের spread শূন্য হতো (একটা গ্রুপের সবাই একই রকম), গ্রুপগুলোর mean তবুও একে অপরের থেকে অনেক আলাদা হতে পারতো — সেটাই between-group টার্ম, আর এটা ঠিক , সেকশন ৮-এর সেই random রাশির variance।
অ্যাপ্লিকেশন। এই ভাঙনটাই ANOVA-ধরনের রিজনিং-এর ফর্মাল ভিত্তি ("মোট ভেরিয়েশনের কতটুকু গ্রুপ মেম্বারশিপে ব্যাখ্যা হয়, আর কতটুকু গ্রুপের ভেতরেই অব্যাখ্যাত থাকে?") আর এটা সরাসরি এনসেম্বল মেথডেও দেখা যায়, যেখানে একটা মডেলের মোট prediction variance ভাগ হয়ে যায় একটা bootstrap স্যাম্পলের ভেতরের variance আর আলাদা bootstrap স্যাম্পলগুলোর মধ্যেকার variance-এ।
এখন পর্যন্ত যা বানানো হয়েছে তার কিছুই ঠিক দুইটা ভ্যারিয়েবলে সীমাবদ্ধ না। -এর জন্য, joint PMF হলো , আর joint PDF একই non-negativity আর total-probability-সমান-1 নিয়ম মানে, শুধু আরেকটা ডাইমেনশনের ওপর যোগ/ইন্টিগ্রেট করে।
সেকশন ২–৮-এর প্রতিটা আইডিয়া সরাসরি এক্সটেন্ড হয়: joint expectation হয়ে যায় ; তিনটার independence-এর জন্য প্রতিটা ট্রিপলে লাগে (এটা যেকোনো দুইটার pairwise independent হওয়ার চেয়ে একটা শক্তিশালী শর্ত — pairwise independence স্বয়ংক্রিয়ভাবে পুরোপুরি joint independence ইমপ্লাই করে না, এটা একটা ক্লাসিক্যাল সূক্ষ্ম বিষয় যেটা মনে রাখা দরকার)।
তিন-ভ্যারিয়েবল joint distribution থেকে একটা marginal পেতে, তুমি যতগুলো ভ্যারিয়েবল চাও না, সেগুলো যোগ/ইন্টিগ্রেট করে বাদ দাও। শুধু বাদ দিলে -এর joint পাওয়া যায়: । আর দুইটাই বাদ দিলে -এর নিজস্ব সিঙ্গেল-ভ্যারিয়েবল marginal পাওয়া যায়: ।
একই ভাগের নিয়মও এক্সটেন্ড হয়: — -এর distribution, সেই স্লাইসে সীমাবদ্ধ যেখানে আর দুইটাই আগে থেকে জানা।
বাস্তবে, "কয়েকটা" ভ্যারিয়েবল আসল ফিচার ভেক্টর নিয়ে কাজ করলে "কয়েকশ" হয়ে যায় — কয়েক ডজন ফিচারের ওপর একটা joint PMF/PDF সরাসরি লিখে বের করা প্রায় কখনোই সম্ভব হয় না। এর বদলে মডেলগুলো স্ট্রাকচারাল অ্যাসাম্পশন নেয় (independence, conditional independence, multivariate Normal-এর মতো নির্দিষ্ট একটা প্যারামেট্রিক ফ্যামিলি — সেকশন ১৩) যা একটা অন্যথায় অসম্ভবরকম বড় joint distribution-কে কাজ করার মতো বানায়।
একাধিক ফিচার
p কলামের একটা ডেটাসেট রো p সংখ্যক random variable-এর ওপর একটা joint distribution থেকে নেওয়া একটা স্যাম্পল — এই সেকশনের সবকিছু সরাসরি প্রযোজ্য, শুধু ট্র্যাক করার ভ্যারিয়েবল বেশি।
ফিচার ভেক্টর
ML জুড়ে ব্যবহৃত X = (X1, ..., Xp) ভেক্টর নোটেশনটা ঠিক সেই multivariate random variable, যেটাতে এই সেকশন জেনারেলাইজ করে।
Multivariate ডেটা
আসল ডেটাসেটগুলো ছদ্মবেশে joint distribution — কলামগুলোর ওপর হিসাব করা প্রতিটা সামারি স্ট্যাটিস্টিক (mean, covariance ম্যাট্রিক্স, correlation) সেই আন্ডারলাইং joint distribution-এর একটা বৈশিষ্ট্য।
Multivariate Normal (Gaussian) distribution হলো পরিচিত বেল-কার্ভ Normal distribution-এর সরাসরি এক্সটেনশন, একসাথে একাধিক ভ্যারিয়েবলে — একটা মাত্র সংখ্যার randomness একটা mean-এর চারপাশে জমা হওয়ার বদলে, সংখ্যার একটা পুরো ভেক্টর একটা mean ভেক্টরের চারপাশে জমা হয়, একটা নির্দিষ্ট, ভালোভাবে বোঝা যায় এমন শেপ কন্ট্রোল করে ভ্যারিয়েবলগুলো কীভাবে ছড়িয়ে থাকে আর সম্পর্কিত হয়।
একটামাত্র mean -এর বদলে, একটা multivariate Normal-এর একটা mean vector থাকে — প্রতিটা ভ্যারিয়েবলের জন্য একটা mean, প্রতিটা কম্পোনেন্টের জন্য ঠিক ।
একটামাত্র variance -এর বদলে, এর আছে expectation/variance/covariance চ্যাপ্টারের সেকশন ৭-এর covariance matrix — ডায়াগোনাল এন্ট্রিগুলো প্রতিটা ভ্যারিয়েবলের নিজস্ব variance, off-diagonal এন্ট্রিগুলো জোড়া-জোড়া covariance।
যেখানে: হলো ভ্যারিয়েবলের সংখ্যা, হলো covariance matrix-এর determinant, আর হলো তার inverse। এক্সপোনেন্টের মূল অংশ, , একটা distance-এর মতো রাশি (Mahalanobis distance, স্কোয়ার্ড) যা মাপে mean থেকে কত দূরে, এমন ইউনিটে যা স্বয়ংক্রিয়ভাবে প্রতিটা ভ্যারিয়েবলের নিজস্ব স্কেল আর ভ্যারিয়েবলগুলোর মধ্যেকার correlation হিসাবে নেয় — সিঙ্গেল-ভ্যারিয়েবল Normal-এর -এর multivariate জেনারেলাইজেশন।
"Multivariate Normal" আর "joint Gaussian distribution" একই অবজেক্ট — "joint" শব্দটা প্রায়ই বিশেষভাবে জোর দিতে যোগ করা হয় যে এটা একাধিক ভ্যারিয়েবল একসাথে বর্ণনা করছে, শুধু একটা ভ্যারিয়েবল একা না।
একটা শক্তিশালী ক্লোজার প্রপার্টি: যদি একসাথে multivariate Normal ফলো করে, তাহলে শুধু -ও (তার marginal, সেকশন ৩ অনুযায়ী) Normal হয় — একটা সাধারণ, সিঙ্গেল-ভ্যারিয়েবল Normal, mean আর variance নিয়ে, সরাসরি mean vector আর covariance matrix থেকে টেনে বের করা। একটা multivariate Normal-কে marginalize করলে সবসময় আরেকটা (কম-ডাইমেনশনাল) multivariate Normal-ই পাওয়া যায় — বেশিরভাগ joint distribution-এ এটা হয় না, আর multivariate Normal এত সুবিধাজনক হওয়ার এটা একটা বড় কারণ।
আরও শক্তিশালী একটা ক্লোজার প্রপার্টি: দেওয়া থাকলে -এর conditional distribution, যখন একসাথে Normal, সেটা নিজেও Normal — একটা conditional mean যা -এর সাথে লিনিয়ারলি শিফট করে, আর একটা conditional variance যা unconditional variance-এর চেয়ে ছোট যখনই আর কোরিলেটেড (Y জানা সত্যিই X-কে সংকুচিত করে)। এই একটা ফ্যাক্টই Gaussian Process regression আর Kalman filter-এর গাণিতিক ভিত্তি।
মাত্র mean vector-ই তোমাকে বলে distribution কোথায় কেন্দ্রীভূত; শুধু covariance matrix-ই তোমাকে বলে এর শেপ — probability mass-এর ক্লাউডটা কতটা প্রসারিত, কাত হয়ে আছে, আর কোরিলেটেড। এই দুইটা অবজেক্ট একসাথে একটা multivariate Normal-কে পুরোপুরি নির্ধারণ করে — আর কিছু স্পেসিফাই করার দরকার নেই।
বিশেষভাবে multivariate Normal-এর জন্য (আর শুধু Normal-এর জন্য — এটা যেকোনো distribution-এর জন্য জেনারেলাইজ করে না), zero covariance আর independence আসলে সমতুল্য। এটা Gaussian ফ্যামিলির একটা বিশেষ প্রপার্টি: সেকশন ৭-এর সাধারণ ওয়ার্নিং ("zero covariance independence ইমপ্লাই করে না")-এর ঠিক একটা সুপরিচিত ব্যতিক্রম আছে, আর সেটা হলো multivariate Normal।
ধরো আর । Correlation — শক্তভাবে পজিটিভলি কোরিলেটেড। কন্টুর ইলিপ্সগুলো লাইন বরাবর তীব্রভাবে কাত হবে, কারণ এই distribution-এ বড় মান শক্তভাবে বড় মানের সাথে যুক্ত।
Gaussian মডেল
Gaussian Discriminant Analysis আর Gaussian Naive Bayes দুইটাই প্রতিটা ক্লাসের ফিচারকে একটা multivariate Normal হিসেবে মডেল করে, তারপর ক্লাসগুলোর মধ্যে density তুলনা করে ক্লাসিফাই করে।
Gaussian Mixture Models
GMM পুরো ডেটাসেটকে বেশ কয়েকটা multivariate Normal-এর একটা ওজনযুক্ত মিশ্রণ হিসেবে মডেল করে, ক্লাস্টারগুলোকে সম্পূর্ণ গোলাকার হতে বাধ্য না করেই আলাদা শেপ, অরিয়েন্টেশন, আর কোরিলেশন দেয়।
Anomaly Detection
একটা ফিট করা multivariate Normal-এর mean থেকে দূরে থাকা একটা পয়েন্ট, সাধারণ Euclidean distance-এর বদলে Mahalanobis distance-এ মাপা, অ্যানোমালাস হিসেবে ফ্ল্যাগ করা হয় — এই পথে কোরিলেটেড ফিচার সঠিকভাবে হিসাবে নেওয়া হয়।
Generative Modeling
ডেটার (বা প্রতিটা ক্লাসের) সাথে একটা multivariate Normal ফিট করা নিজেই একটা generative মডেল — এটা ব্যবহার করে নতুন, সিন্থেটিক পয়েন্ট স্যাম্পল করা যায় যা ট্রেনিং ডেটার মতো দেখতে।
Bayesian Machine Learning
Multivariate Normal-এর কাজের marginal আর conditional প্রপার্টি (এই সেকশন) ঠিক সেই কারণ Gaussian Process আর অনেক Bayesian মডেল কম্পিউটেশনালি কাজ করার মতো হয়।
একটা joint PDF আক্ষরিক একটা 3D সারফেস হিসেবে আঁকা যায় — প্লেনের প্রতিটা পয়েন্টে উচ্চতা সেখানকার density-র সমান। চূড়া দেখায় কোথায় জোড়া সবচেয়ে সম্ভাব্য; উপত্যকা দেখায় কোথায় এগুলো বিরল।
সেই 3D সারফেসটাকে বিভিন্ন উচ্চতায় ভূমি-সমান্তরালভাবে কাটলে, তারপর সোজা নিচে তাকালে, একটা কন্টুর প্লট পাওয়া যায় — নেস্টেড কার্ভ, প্রতিটা সমান density-র পয়েন্ট যুক্ত করে, ঠিক টপোগ্রাফিক ম্যাপের এলিভেশন লাইনের মতো। এটা পুরো 3D সারফেসের চেয়ে সাধারণত পড়া সহজ, আর বাস্তবে joint density ভিজুয়ালাইজ করার স্ট্যান্ডার্ড উপায় (সেকশন ১৩-এর কন্টুর উদাহরণে যেভাবে ব্যবহৃত হয়েছে)।
সেকশন ৩-এর marginalization-এর একটা পরিষ্কার জ্যামিতিক ছবিও আছে: হলো যদি তুমি পুরো 3D সারফেসটাকে -অক্ষের ওপর সোজা প্রজেক্ট (সংকুচিত) করে "চ্যাপ্টা" করতে, প্রতিটা ফিক্সড -এর জন্য প্রতিটা -এর উচ্চতা যোগ করে, তাহলে যা দেখতে।
জ্যামিতিকভাবে, হলো সারফেসের একটা একটামাত্র উলম্ব স্লাইস, একটা নির্দিষ্ট -এ নেওয়া, তারপর রিস্কেল করা (( দিয়ে ভাগ করে)) যেন সেই স্লাইসের নিজস্ব area ঠিক 1-এ ইন্টিগ্রেট করে।
একটা jointly Gaussian জোড়ার জন্য, correlation সরাসরি কন্টুরের কাত নিয়ন্ত্রণ করে (সেকশন ১৩): বৃত্তাকার কন্টুর দেয়; হলে, ইলিপ্সগুলো ডায়াগোনাল বরাবর আরও প্রসারিত আর কাত হতে থাকে, লিমিটে একটা সরলরেখায় সংকুচিত হয়।
| Independent | Correlated | |
|---|---|---|
| কন্টুর শেপ (Gaussian কেস) | অক্ষ-বরাবর বৃত্ত/ইলিপ্স | কাত, প্রসারিত ইলিপ্স |
| সারফেস শেপ | পরিষ্কারভাবে দুইটা আলাদা 1D বেল শেপের গুণফলে ফ্যাক্টর হয় | দুইটা আলাদা 1D শেপে ভাগ করা যায় না — কাতটা joint সারফেসের অন্তর্নিহিত অংশ |
| X জানা Y সম্পর্কে ধারণা বদলায়? | না — conditional স্লাইসগুলো সব একই রকম দেখতে, শুধু রিস্কেলড | হ্যাঁ — বদলালে conditional স্লাইসের পজিশন বদলায় |
একটা ডেটাসেটের প্রতিটা কলাম — প্রতিটা ফিচার, আর টার্গেটও — একটা random variable হিসেবে ধরা হয়। একটা মাত্র রো হলো কোনো আন্ডারলাইং, সাধারণত অজানা, joint distribution থেকে একটা joint draw ।
, বা একটা সিঙ্গেল ফিচার-টার্গেট জোড়ার জন্য শুধু , হলো ইনপুট আর টার্গেটের ওপর পুরো joint distribution — ডেটা-জেনারেটিং প্রসেসের সবচেয়ে সম্পূর্ণ বর্ণনা যা সম্ভব।
, বাকি সব বাদ দিয়ে একটা ফিচারের নিজস্ব distribution, ঠিক সেটাই যা একটা সিঙ্গেল-কলাম হিস্টোগ্রাম বা সামারি স্ট্যাটিস্টিক এস্টিমেট করে — কাজের, কিন্তু এটা অন্য ফিচার বা টার্গেটের সাথে সেই ফিচারের প্রতিটা সম্পর্ক হারিয়ে ফেলে।
— দেওয়া ফিচার অনুযায়ী টার্গেটের distribution — এটাই প্রায় প্রতিটা supervised learning মেথড যা, কোনো না কোনো রূপে, অ্যাপ্রোক্সিমেট করার চেষ্টা করে।
| নোটেশন | মানে কী | কোথায় দেখা যায় |
|---|---|---|
| ফিচার আর টার্গেটের পুরো joint distribution | Generative মডেল এটা সরাসরি শেখে | |
| ফিচার দেওয়া থাকলে টার্গেটের distribution | Discriminative মডেল এটা সরাসরি শেখে; regression/classification মূলত যা এস্টিমেট করছে | |
| শুধু ফিচারদের marginal distribution, টার্গেট বাদ দিয়ে | Density estimation, anomaly detection, আর 'এই ইনপুট আদৌ বাস্তবসম্মত কিনা' চেক |
| Generative Modeling | Discriminative Modeling | |
|---|---|---|
| কী শেখে | পুরো joint | সরাসরি |
| কীভাবে prediction করে | শেখা joint থেকে বের করে, সেকশন ৪-এর সম্পর্ক দিয়ে | আগে থেকেই আছে — বাড়তি স্টেপ লাগে না |
| X-এর নতুন স্যাম্পল জেনারেট করতে পারে? | হ্যাঁ — এটা X-এর নিজস্ব distribution-ও মডেল করেছে | না — এটা কখনো মডেলই করেনি, শুধু conditional |
| উদাহরণ | Naive Bayes, Gaussian Mixture Models, GAN, VAE | Logistic regression, স্ট্যান্ডার্ড নিউরাল নেটওয়ার্ক ক্লাসিফায়ার, SVM |
| সাধারণ ডেটা এফিশিয়েন্সি | কম লেবেলড ডেটা দিয়ে কাজ করতে পারে, কারণ এটা বেশি স্ট্রাকচার মডেল করে | সাধারণত বেশি লেবেলড ডেটা লাগে, কিন্তু প্রায়ই X থেকে Y অনুমান করার নির্দিষ্ট কাজে বেশি নির্ভুল |
Generative Modeling: শেখো, তারপর সেকশন ৪-এর সম্পর্ক ব্যবহার করে বের করো। Discriminative Modeling: joint সম্পূর্ণ এড়িয়ে সরাসরি শেখো। Prediction-এর সময় দুইটাই একই conditional distribution টার্গেট করে — শুধু পার্থক্য এটা যে পথে joint distribution মডেল করা হয় কিনা।
Joint Probability Table. দুইটা ডাইস একবার করে রোল করা হলো; =প্রথম ডাইস, =দ্বিতীয় ডাইস, দুইটাই -এর ওপর uniform, independent। joint টেবিলের প্রতিটা সেল ।
Marginal Probability হিসাব. — যেমন আশা করা যায়, ঠিক একটা fair ডাইসের নিজস্ব PMF-এর সাথে মিলে যায়।
Conditional Probability হিসাব. — unconditional -এর সাথে ঠিক একই, independence নিশ্চিত করে।
Independence টেস্টিং. আর — মিলছে, প্রতিটা সেলের জন্য, তাই দুইটা ডাইস independent, ঠিক যেমন ফিজিক্যাল সেটআপ থেকে বোঝা যায়।
Joint PDF. , -এর জন্য — ভ্যালিডিটি চেক করো: ।
Marginal PDF. — একটা Exponential(1) distribution।
Region-এর ওপর Probability. ।
Conditional PDF. — -এর সাথে একদম মিলে যায় আর -এর ওপর একদমই নির্ভর করে না, এখানেও আর independent নিশ্চিত করে (এই নির্দিষ্ট joint density -এ পরিষ্কার ফ্যাক্টর হয়)।
দুইটা ফিচার → Joint Distribution. "স্কয়ার ফুটেজ" আর "বেডরুমের সংখ্যা" ফিচার নিয়ে বাড়ির দামের ডেটার একটা joint distribution আছে — বড় বাড়িতে সাধারণত বেশি বেডরুম থাকে, তাই এই ফিচারগুলো dependent, independent না।
ফিচার → Marginal Distribution. শুধু "স্কয়ার ফুটেজ"-এর হিস্টোগ্রাম, বেডরুম পুরোপুরি বাদ দিয়ে, সেই একটা ফিচারের marginal distribution-এর একটা এস্টিমেট।
ফিচার দেওয়া থাকলে Target → Conditional Distribution. "স্কয়ার ফুটেজ আর বেডরুম দেওয়া থাকলে দাম" হলো — ঠিক এই ডেটাসেটের একটা regression মডেল যা এস্টিমেট করার চেষ্টা করছে।
ফিচার Correlation → Covariance. একটা শক্তিশালী পজিটিভ এই দুইটা ফিচারকে ওভারল্যাপিং তথ্য বহন করা হিসেবে ফ্ল্যাগ করবে — মডেলিং-এর আগে রিডানডেন্সি কমানোর জন্য বিবেচনার জোড়া।
১. Joint PMF বানাও। দুইটা fair কয়েন টস করা হলো; = কয়েন 1-এ হেডসের সংখ্যা (0 বা 1), = কয়েন 2-এ হেডসের সংখ্যা (0 বা 1)। Joint PMF টেবিল বানাও।
সমাধান: চারটা আউটকাম (0,0),(0,1),(1,0),(1,1) সমান সম্ভাব্য: প্রতিটার জন্য ।
২. Joint Probability হিসাব করো। প্রবলেম ১-এর টেবিল ব্যবহার করে, বের করো।
সমাধান: , সরাসরি টেবিল থেকে।
৩. Marginal PMF হিসাব করো। প্রবলেম ১-এর টেবিল ব্যবহার করে, বের করো।
সমাধান: ।
৪. Marginal PDF হিসাব করো। দেওয়া আছে , -এর জন্য, বের করো।
সমাধান: , -এর জন্য।
৫. Conditional Distribution বের করো। প্রবলেম ১-এর টেবিল ব্যবহার করে, বের করো।
সমাধান: ।
৬. Independence টেস্ট করো। Joint PMF: । X আর Y কি independent?
সমাধান: । চেক করো: । Dependent।
৭. Joint Expectation হিসাব করো। প্রবলেম ১-এর টেবিল ব্যবহার করে, বের করো।
সমাধান: শুধু অবদান রাখে: ।
৮. Covariance হিসাব করো। প্রবলেম ৬-এর টেবিল ব্যবহার করে, বের করো।
সমাধান: । । ।
৯. Multivariate Normal প্রবলেম। দেওয়া আছে আর , correlation বের করো।
সমাধান: ।
১০. Conditional Gaussian প্রবলেম। প্রবলেম ৯-এর একই -এর জন্য, কি -এর চেয়ে বড় নাকি ছোট?
সমাধান: ছোট — কারণ আর কোরিলেটেড (), জানা -এর অনিশ্চয়তা কমায়, সেকশন ১৩-এর conditional Gaussian প্রপার্টি অনুযায়ী।
১১. Marginalization প্রবলেম। দেওয়া আছে joint PDF , -এর জন্য, ভ্যালিড কিনা যাচাই করো আর বের করো।
সমাধান: , ভ্যালিড। , -এর জন্য।
১২. ML-Based Joint Distribution প্রবলেম। একটা ডেটাসেটের ফিচার (আয়) আর (খরচ)-এর , , । এখানে ফিচার independence ধরে নেওয়া একটা generative মডেলের জন্য নিরাপদ সিম্পলিফিকেশন হবে কি?
সমাধান: — খুব শক্তিশালী correlation, তাই independence ধরে নিলে একটা বড়, বাস্তব সম্পর্ক বাদ পড়ে যাবে। এই dependence ধরতে পারে (বা স্পষ্টভাবে একটাকে আরেকটার শর্তে রাখে) এমন একটা মডেল সম্ভবত লক্ষণীয়ভাবে ভালো পারফর্ম করবে।
Multivariate Probability
কেন একাধিক random variable একসাথে স্টাডি করলে এমন সম্পর্ক ধরা পড়ে যা একটা মাত্র ভ্যারিয়েবল দিয়ে পারে না।
Joint Distribution
Joint PMF/PDF — মান-কম্বিনেশন-এর প্রতিটার ওপর probability বা density।
Marginal Distribution
অন্যটাকে যোগ/ইন্টিগ্রেট করে বাদ দিয়ে একটা ভ্যারিয়েবলের নিজস্ব distribution বের করো।
Conditional Distribution
অন্য ভ্যারিয়েবলের জানা মানে joint distribution সীমাবদ্ধ করো।
Independence
সেই বিশেষ কেস যেখানে joint শুধু marginal-দুটোর চেয়ে বাড়তি কোনো তথ্য বহন করে না।
Joint Expectation আর Covariance
একাধিক ভ্যারিয়েবলের ফাংশনে expectation এক্সটেন্ড করো; covariance-কে joint-distribution রাশি হিসেবে আবার দেখো।
Conditional Expectation আর Total Law-গুলো
গ্রুপ-অনুযায়ী conditional সামারিগুলো আবার একত্র করে unconditional probability, expectation, আর variance বানাও।
Multivariate Normal
সবচেয়ে গুরুত্বপূর্ণ নামকরণ করা joint distribution, অনন্যভাবে সুবিধাজনক marginal আর conditional প্রপার্টি নিয়ে।
ML অ্যাপ্লিকেশন
ফিচার আর টার্গেটকে একটা joint distribution হিসেবে দেখো, আর generative বনাম discriminative modeling-কে এটা ব্যবহারের দুইটা উপায় হিসেবে দেখো।