Chapter 6 of 7
Boiling a whole distribution down to its center, spread, and how variables move together
আগের চ্যাপ্টারে তুমি অনিশ্চিত ফলাফলকে সংখ্যায় রূপান্তর করা শিখেছো — random variable — আর সংক্ষেপে এর mean আর spread নিয়েও কথা বলেছো। এই চ্যাপ্টারে সেই দুইটা আইডিয়া — expectation আর variance — একদম শুরু থেকে গড়ে তোলা হবে, আর তৃতীয় একটা আইডিয়া — covariance — যোগ হবে, যেটা বলে দুইটা random variable কীভাবে একসাথে বদলায়।
এই তিনটা সংখ্যা এত গুরুত্বপূর্ণ কেন? কারণ একটা পুরো probability distribution — একটা গোটা PMF টেবিল, বা একটা গোটা PDF কার্ভ — অনেক তথ্য বহন করে। বেশিরভাগ সময় তোমার পুরো শেপের প্রতিটা ডিটেইল লাগে না; লাগে কয়েকটা সামারি সংখ্যা, যেগুলো মানুষ আসলেই জিজ্ঞেস করে এমন প্রশ্নের উত্তর দেয়: "সাধারণ মান কত?" (expectation), "সেই সাধারণ মানের চারপাশে কতটা ছড়িয়ে আছে?" (variance), আর "যখন এই ভ্যারিয়েবলটা বেশি, তখন অন্য ভ্যারিয়েবলটাও কি বেশি হওয়ার প্রবণতা দেখায়?" (covariance)। তিনটা সংখ্যা, আর হঠাৎ করেই বিশাল রকম ডেটা এমন কিছুতে পরিণত হয় যা নিয়ে তুমি চিন্তা করতে পারো, তুলনা করতে পারো, আর সিদ্ধান্ত নিতে পারো।
Expectation হলো একটা distribution-এর কেন্দ্র, variance হলো তার spread, আর covariance হলো দুইটা distribution-এর spread একে অপরের সাথে কতটা মিলে যায় — তিনটা সংখ্যা যা একটা সম্পূর্ণ probability distribution-কে এমন কিছুতে সংকুচিত করে যা নিয়ে মানুষ (বা একটা মডেল) আসলেই কাজ করতে পারে।
এগুলো শুধু স্ট্যাটিসটিক্স ক্লাসের বিমূর্ত জিনিস না। প্রতিবার যখন একটা মডেল ট্রেইন করা হয়, সে আসলে একটা expected loss মিনিমাইজ করছে। প্রতিবার যখন একটা মডেলকে একাধিকবার ট্রেইন করে মূল্যায়ন করা হয়, তার variance-ই বলে দেয় সে নির্ভরযোগ্য নাকি অস্থির। প্রতিবার যখন ফিচারগুলো তুলনা করা হয়, রিডানডেন্সির জন্য স্ক্রিন করা হয়, বা PCA-তে ফিড করা হয় — covariance-ই সেই কাজটা করছে। এই চ্যাপ্টার ঠিক সেই ভোকাবুলারিটাই তৈরি করে, যেটা দিয়ে bias-variance tradeoff, regularization, PCA, আর Gaussian মডেল লেখা হয়।
মনে করে দেখো: একটা random variable তার distribution অনুযায়ী মান নেয় — discrete হলে একটা PMF , আর continuous হলে একটা PDF । এই চ্যাপ্টারের সবকিছুই সেই distribution থেকে হিসাব করা হয়। distribution বদলালে, সেখান থেকে হিসাব করা প্রতিটা expectation, variance, আর covariance-ও বদলে যায় — এগুলো একটা distribution-এর বৈশিষ্ট্য, আলাদা কিছু না।
দুইটা ফ্যাক্টরির কথা ভাবো, দুটোই এমন বোল্ট বানায় যাদের গড় ব্যাস 10mm। ফ্যাক্টরি A-এর বোল্টগুলো প্রায় সবসময়ই 10mm থেকে 0.01mm-এর মধ্যে থাকে। ফ্যাক্টরি B-এর বোল্টগুলো 9mm থেকে 11mm পর্যন্ত দুলতে থাকে। একই গড়, কিন্তু নির্ভরযোগ্যতা সম্পূর্ণ আলাদা। শুধু গড় (expectation) বলে দেয় ডেটা কোথায় কেন্দ্রীভূত; সেই কেন্দ্র বিশ্বাসযোগ্য নাকি এলোমেলো গড়ের ফলাফল, সেটা বুঝতে দ্বিতীয় একটা সংখ্যা (variance) লাগবে। এই চ্যাপ্টার মূলত দুটো প্রশ্নই সবসময় একসাথে জিজ্ঞেস করা শেখানো, কখনো শুধু একটা না।
একটা random variable-এর expected value, লেখা হয়, হলো সেই লং-রান গড় মান যেটা তুমি পেতে, যদি তুমি সেই র্যান্ডম এক্সপেরিমেন্টটা বিপুল সংখ্যক বার রিপিট করে ফলাফলগুলোর গড় নিতে। একে সেই random variable-এর mean-ও বলা হয়।
ইনটুইশন। একটা fair ডাইস দশ লাখ বার রোল করে সব রোলের গড় নেওয়ার কথা ভাবো। তুমি ঠিক 3.5 পাবে না (কোনো একটা রোলই কখনো 3.5 হতে পারে না), কিন্তু দশ লাখ রোলের গড় 3.5-এর খুব কাছাকাছি চলে আসবে। সেই লিমিটিং মান — যেখানে ট্রায়াল সংখ্যা যত বাড়তে থাকে গড়টা তত সেই মানের দিকে এগোতে থাকে — সেটাই ।
একটা weighted average — -এর প্রতিটা সম্ভাব্য মানকে তার probability দিয়ে ওজন দেওয়া হয়, তারপর সব যোগ করা হয়। এখানেই সাধারণ arithmetic mean থেকে এর মূল পার্থক্য।
| Arithmetic Mean | Expected Value | |
|---|---|---|
| কী গড় করে | আগে থেকে পর্যবেক্ষণ করা একটা নির্দিষ্ট সংখ্যার লিস্ট | একটা random variable যত মান নিতে পারে, তার সবগুলো |
| ওজন | প্রতিটা পর্যবেক্ষিত সংখ্যা সমান গুরুত্ব পায় (সংখ্যা দিয়ে ভাগ) | প্রতিটা সম্ভাব্য মান তার নিজের probability দিয়ে ওজন পায় |
| কখন হিসাব করা যায় | শুধু ডেটা সংগ্রহ করার পর | কোনো এক্সপেরিমেন্ট চালানোর আগেই, শুধু distribution থেকে |
| ফর্মুলা |
-কে distribution-এর "ব্যালান্স পয়েন্ট" হিসেবে ভাবো — যদি তুমি PMF বার বা PDF কার্ভ কার্ডবোর্ড দিয়ে কেটে একটা আঙুলের উপর ব্যালান্স করার চেষ্টা করতে, শেপটা যেন উল্টে না যায়, আঙুলটা ঠিক -এর জায়গায় থাকতে হবে।
যেখানে: প্রতিটা সম্ভাব্য মান -কে সেই মানের probability দিয়ে গুণ করো, তারপর সব প্রোডাক্ট যোগ করো। যেসব মান বেশি ঘটে, সেগুলো যোগফলটাকে নিজের দিকে বেশি টেনে নেয় — এখানেই "ওজন দেওয়া" মানে।
হিসাব করা উদাহরণ। একটা fair কয়েন ৩ বার টস করা হলো; = হেডসের সংখ্যা, PMF: ।
লক্ষ্য করো, এমন কোনো মান না যা আসলে কখনো নিতে পারে (তিন টসের কোনো একটা সেটে তুমি "1.5 হেডস" পাবে না) — expectation বহুবার রিপিট করার লং-রান গড় বর্ণনা করে, একটা একক ট্রায়াল সম্পর্কে ভবিষ্যদ্বাণী না।
যেখানে: একই weighted-average আইডিয়া, শুধু sum-এর জায়গায় ইন্টিগ্রাল আর PMF -এর জায়গায় density — -এর প্রতিটা অসীম-পাতলা স্লাইসকে তার density দিয়ে ওজন দিয়ে যোগ (accumulate) করা হয়।
হিসাব করা উদাহরণ। ধরো -এর density , -এর জন্য (বাকি সব জায়গায় 0) — একটা ভ্যালিড PDF, কারণ ।
যেহেতু বড় -মানের দিকে বেশি density দেয়, তাই -এর মাঝামাঝি বিন্দু (0.5) থেকে উপরে থাকাটাই স্বাভাবিক।
Expectation সম্পর্কে সবচেয়ে কাজের ফ্যাক্টটা হলো এটা linear — sum আর constant গুণের মধ্য দিয়ে পরিষ্কারভাবে ছড়িয়ে যায়, আর অবাক করা ব্যাপার হলো, এটা তখনও সত্যি যখন এতে থাকা random variable-গুলো একে অপরের উপর নির্ভরশীল।
যেখানে: যেকোনো constant, আর এই আইডেন্টিটি সত্যি হবে আর independent হোক, correlated হোক, বা মাঝামাঝি যাই হোক না কেন।
| নিয়ম | স্টেটমেন্ট | নোট |
|---|---|---|
| একটা constant-এর expectation সেই constant-ই — গড় করার মতো কিছু নেই | ||
| স্কেলিং আর শিফটিং সরাসরি expectation-এর মধ্য দিয়ে চলে যায় | ||
| সবসময় সত্যি, X আর Y dependent হলেও | ||
| সাধারণভাবে | শুধু X আর Y independent হলে সমান হয় — ঠিক এখানেই covariance (সেকশন ৫) প্রবেশ করে | |
| (বা ইন্টিগ্রাল ফর্ম) | নিজে না, -কে X-এর নিজের probability/density দিয়ে ওজন দাও |
মনে হতে পারে expectation যোগফলের মতোই গুণের উপরও ডিস্ট্রিবিউট করে। করে না — শুধু তখনই সত্যি যখন আর independent। dependent হলে, আর -এর মধ্যেকার ফাঁকটাই ঠিক covariance যা মাপে (সেকশন ৫.৩)।
-কে -এর first moment বলা হয়। আরো সাধারণভাবে, -তম raw moment হলো :
| Moment | ফর্মুলা | কী মাপে |
|---|---|---|
| First moment | distribution-এর কেন্দ্র / অবস্থান | |
| Second moment | variance-এর শর্টকাট ফর্মুলায় সরাসরি ব্যবহৃত হয় (সেকশন ৩.৩) | |
| Third moment (central) | Skewness — distribution-এর অসামঞ্জস্যতা (সেকশন ৪) | |
| Fourth moment (central) | Kurtosis — distribution-এর টেইল কতটা ভারী (সেকশন ৪) |
Raw moment বনাম central moment। একটা raw moment () মাপা হয় অরিজিন (0) থেকে। একটা central moment () মাপা হয় distribution-এর নিজের মিন থেকে। Variance (সেকশন ৩) হলো ঠিক দ্বিতীয় central moment — এটা -এর দ্বিতীয় moment না, বরং মিন থেকে ডেভিয়েশনের দ্বিতীয় moment। এই পার্থক্যটা গুরুত্বপূর্ণ, কারণ পুরো distribution শিফট করলে raw moment বদলে যায়, কিন্তু central moment (প্রথমটা ছাড়া, যেটা সবসময় 0) বদলায় না — সেগুলো শুধু শেপ বর্ণনা করে, লোকেশন না।
বলে দেয় একটা distribution কোথায় কেন্দ্রীভূত, কিন্তু বলে না তার মানগুলো কতটা ছড়িয়ে আছে — আর সেকশন ১-এর দুই ফ্যাক্টরির গল্পটা যেমন দেখিয়েছে, দুইটা distribution একই মিন শেয়ার করেও সম্পূর্ণ আলাদা আচরণ করতে পারে। Variance ঠিক সেই ফাঁকটাই পূরণ করে: এটা মাপে তার নিজের মিন থেকে কতটা দূরে থাকার প্রত্যাশা করা যায়, স্কয়ার করে।
স্বাভাবিক প্রথম আইডিয়া হলো -এর গড় দিয়ে spread মাপা — কিন্তু সেটা সবসময় ঠিক 0 হয়, কারণ positive ডেভিয়েশন (মিনের উপরের মানগুলো) আর negative ডেভিয়েশন (নিচের মানগুলো) মিনের সংজ্ঞা অনুযায়ীই একে অপরকে ক্যানসেল করে দেয়। প্রথমে স্কয়ার করলে চিহ্নটা মুছে যায়, তাই positive আর negative ডেভিয়েশন দুটোই একে অপরকে ক্যানসেল না করে আসল "spread" হিসেবে গোনা হয়।
Discrete random variable-এর জন্য:
Continuous random variable-এর জন্য:
দুই ক্ষেত্রেই রেসিপি একই — তিন ধাপ: প্রতিটা মানের মিন থেকে ডেভিয়েশন বের করো (), স্কয়ার করো, তারপর সেই স্কয়ার করা ডেভিয়েশনগুলোর probability-weighted গড় নাও — ঠিক -এর মতো একই ওজন দেওয়ার মেকানিজম, শুধু -এর বদলে -এর উপর প্রয়োগ করা।
যেখানে: প্রথম রূপটা সেকশন ৩.২-এর সরাসরি সংজ্ঞা। দ্বিতীয় রূপটা algebraically একই জিনিস, কিন্তু প্র্যাকটিসে হিসাব করা প্রায় সবসময়ই অনেক সহজ, কারণ এতে শুধু দুইটা সাধারণ expectation লাগে — আর — মিনকে কেন্দ্র করে নতুন করে হিসাব করার দরকার নেই।
হিসাব করা উদাহরণ — একটা fair ডাইস রোল। , আর ।
এক্সপ্যান্ড করো, তারপর expectation-এর linearity (সেকশন ২.৪) টার্ম বাই টার্ম প্রয়োগ করো: । শর্টকাটটা মুখস্থ করার আলাদা কোনো ফ্যাক্ট না — এটা সরাসরি linearity থেকে বেরিয়ে আসে।
| নিয়ম | স্টেটমেন্ট | ইনটুইশন |
|---|---|---|
| একটা constant কখনো নিজের থেকে সরে না — শূন্য spread | ||
| মানগুলোকে দিয়ে স্কেল করলে দূরত্বগুলোও দিয়ে স্কেল হয়, আর variance একটা স্কয়ার করা রাশি, তাই এফেক্টটাও স্কয়ার হয় | ||
| দিয়ে শিফট করলে প্রতিটা মান আর মিন সমান পরিমাণে সরে যায় — মিন থেকে দূরত্বগুলো একই থাকে, তাই পুরোপুরি বাদ পড়ে যায় |
Expectation-এর মতো না — Variance সাধারণত মানে না — এটা শুধু তখনই সত্যি যখন আর independent (বা, আরো নির্দিষ্টভাবে, uncorrelated)। সাধারণভাবে এর জন্য একটা covariance correction টার্ম লাগে, যা সেকশন ৮-এ পুরোপুরি কভার করা হয়েছে।
যেখানে: স্কয়ার রুট নিলে variance-এর ইউনিট — -এর স্কয়ার করা ইউনিট, যেমন "টাকা²" বা "cm²" — আবার -এর নিজের ইউনিটে ফিরে আসে। এই কারণেই মানুষ সাধারণত variance না, স্ট্যান্ডার্ড ডেভিয়েশন রিপোর্ট করে আর ইন্টারপ্রেট করে।
Standard deviation হলো "মিন থেকে সাধারণ দূরত্ব"। একটা উচ্চতার distribution-এর SD সেন্টিমিটারে রিপোর্ট করা হয়, cm²-তে না — ঠিক এই কারণেই, যেন সরাসরি উচ্চতাগুলোর সাথে তুলনা করা যায়। একটা ছোট SD মানে মানগুলো মিনের চারপাশে টাইট হয়ে জড়ো; একটা বড় SD মানে মানগুলো প্রায়ই মিন থেকে অনেক দূরে পাওয়া যায়। ডাইসের উদাহরণে ফিরে গেলে: — একটা সাধারণ রোল মিন 3.5 থেকে প্রায় 1.7 ইউনিট দূরে পড়ে।
প্রিসেট পাল্টাও বা PMF ওজনের স্লাইডার টেনে দেখো E[X], Var(X), আর SD(X) লাইভ আপডেট হচ্ছে, সাথে PMF বার আর CDF।
X = result of one fair six-sided die. Drag any bar's weight below — the PMF renormalizes live.
PMF — P(X = x)
Sum of all bars = 1.000 (a valid PMF always sums to 1)
CDF — F(x) = P(X ≤ x)
F(x) climbs from 0 toward 1 and never decreases — each step's height equals that x's PMF value.
Adjust weights
E[X]
3.500
E[X²]
15.167
Var(X)
2.917
SD(X)
1.708
একটা বারের ওজন সম্পূর্ণ উপরে টেনে দাও বাকিগুলো সংকুচিত হতে থাকা অবস্থায় — দেখো Var(X) প্রায় 0-তে নেমে আসছে, যখন distribution প্রায় একটা নিশ্চিত মানে পরিণত হচ্ছে, তারপর ওজন আবার কয়েকটা বারে ছড়িয়ে দিলে আবার ছড়িয়ে যাচ্ছে।
সেকশন ২.৫ moment-গুলোকে একটা পরিবার হিসেবে পরিচয় করিয়েছিল; এই সেকশনে দেখব কেন্দ্র আর spread ছাড়া প্রতিটা moment একটা distribution-এর শেপ সম্পর্কে কী বলে।
| Moment | কী মাপে | সিমেট্রিক distribution-এ মান |
|---|---|---|
| 1st moment — Mean | distribution কোথায় কেন্দ্রীভূত | সিমেট্রির কেন্দ্র |
| 2nd central moment — Variance | distribution কতটা ছড়িয়ে আছে | যেকোনো positive সংখ্যা হতে পারে |
| 3rd central moment — Skewness | অসামঞ্জস্যতা — একটা টেইল অন্যটার চেয়ে লম্বা কি না | একদম 0 |
| 4th central moment — Kurtosis | টেইল-ওজন — extreme, মিন থেকে দূরের মান কতটা সম্ভাব্য | 3-এর (Normal distribution-এর kurtosis) সাথে তুলনা করা হয় |
সিমেট্রিক বনাম স্কিউড distribution। একটা distribution সিমেট্রিক, যদি তার বাম অর্ধেক মিনের চারপাশে ডান অর্ধেকের আয়নাপ্রতিবিম্ব হয় (একটা fair ডাইস রোল, একটা Normal distribution)। এটা skewed, যদি একটা টেইল অন্যটার চেয়ে বেশি লম্বা হয় — positive (ডান) skew মানে বড় মানের দিকে একটা লম্বা টেইল (পারিবারিক আয় একটা ক্লাসিক উদাহরণ: বেশিরভাগ মানুষ মাঝারি রকম আয় করে, কিন্তু খুব বেশি আয়কারীদের একটা লম্বা টেইল মিনকে সাধারণ/মিডিয়ান মানের উপরে টেনে নেয়), আর negative (বাম) skew তার আয়নাপ্রতিবিম্ব ঘটনা।
Distribution বোঝায় moment-এর ভূমিকা। প্র্যাকটিসে প্রথম দুইটা moment (মিন, variance) সবসময় ব্যবহার হয়; skewness আর kurtosis বেছে বেছে ব্যবহার হয় — মূলত এটা চেক করতে যে "মোটামুটি Normal"-এর মতো কোনো ধারণা যুক্তিসঙ্গত কি না, এমন কোনো পদ্ধতি (যেমন অনেক ক্লাসিক্যাল স্ট্যাটিসটিক্যাল টেস্ট) প্রয়োগ করার আগে যা সেই ধারণার উপর নির্ভর করে।
Expectation আর variance দুটোই একটা random variable বর্ণনা করে। Covariance হলো দুইটা random variable-এর জন্য স্বাভাবিক সম্প্রসারণ: এটা মাপে আর একসাথে বদলাতে চায়, বিপরীতভাবে বদলাতে চায়, নাকি কোনো linear সম্পর্কই দেখায় না।
ইনটুইশন। "X তার নিজের মিন থেকে সাধারণত কতটা দূরে থাকে" জিজ্ঞেস করার বদলে, covariance জিজ্ঞেস করে "যখন X তার মিনের উপরে থাকে, Y-ও কি একই সময়ে তার মিনের উপরে থাকার প্রবণতা দেখায়?" — joint variation মাপা হয়, শুধু individual variation না।
| Cov(X,Y)-এর চিহ্ন | মানে |
|---|---|
| Positive | X তার মিনের উপরে থাকলে, Y-ও তার মিনের উপরে থাকার প্রবণতা দেখায় (আর দুটোই একসাথে নিচেও থাকে) — একই দিকে বদলায় |
| Negative | X তার মিনের উপরে থাকলে, Y তার মিনের নিচে থাকার প্রবণতা দেখায় — বিপরীত দিকে বদলায় |
| Zero | কোনো দিকেই স্থায়ী linear প্রবণতা নেই (সেকশন ৫.৪-এর independence সতর্কতা দেখো) |
Population covariance (একটা পুরো, জানা distribution থেকে হিসাব করা — X আর Y-এর joint PMF বা PDF):
Sample covariance (পর্যবেক্ষিত টা ডেটা পেয়ার থেকে অনুমান করা, যখন তুমি আসল distribution জানো না আর শুধু ডেটা আছে):
Population সংস্করণ আসল expectation ব্যবহার করে underlying distribution থেকে; sample সংস্করণ সেগুলো অনুমান করে sample mean দিয়ে, আসল পর্যবেক্ষিত ডেটা থেকে, আর -এর বদলে দিয়ে ভাগ করে — যে কারণে সাধারণ পরিচিতি ক্লাসের sample-variance correction-এর সাথে এটার মিল আছে।
যেখানে: variance-এর শর্টকাট ফর্মুলার (সেকশন ৩.৩) সাথে একদম সমান্তরাল — দ্বিতীয় রূপে শুধু , , আর লাগে, যেগুলো joint আর marginal distribution থেকে সরাসরি হিসাব করা যায়, প্রথমে কিছু সেন্টার করার দরকার নেই।
হিসাব করা উদাহরণ। দুইটা random variable-এর joint PMF: , , , ।
Marginal: , একইভাবে । (শুধু সেলটাই অবদান রাখে, কারণ বা -এর কোনো একটা 0 হলে )।
একটা positive covariance — X আর Y একসাথে 0 হওয়া বা একসাথে 1 হওয়ার প্রবণতা বেশি, একে অপরের সাথে না মেলার চেয়ে।
| নিয়ম | স্টেটমেন্ট | নোট |
|---|---|---|
| নিজের সাথে একটা ভ্যারিয়েবলের covariance ঠিক তার variance-ই — variance হলো covariance-এর একটা বিশেষ ক্ষেত্র | ||
| Covariance সিমেট্রিক — অর্ডার ম্যাটার করে না | ||
| দিয়ে শিফট করলে বাদ পড়ে যায় (variance-এর মতো একই যুক্তি); দিয়ে স্কেল করলে একবারই পাস হয়, স্কয়ার না | ||
| Covariance প্রতিটা আর্গুমেন্টে আলাদাভাবে linear (bilinear) | ||
| দুইটা স্কেল ফ্যাক্টরই গুণ হয়ে যায়; দুইটা শিফটই বাদ পড়ে |
আর independent হলে, সবসময় ঠিক 0। উল্টোটা নিশ্চিত না: দুইটা ভ্যারিয়েবল zero covariance রাখতে পারে, তবু dependent থাকতে পারে, যদি সম্পর্কটা শক্তভাবে non-linear হয়। ক্লাসিক উদাহরণ: 0-এর চারপাশে সিমেট্রিক, আর । আর স্পষ্টভাবে dependent ( জানলে ঠিকভাবে জানা যায়), তবু , কারণ covariance শুধু linear প্রবণতাই ধরতে পারে।
Covariance-এর আসল সাইজ আর যে ইউনিটে মাপা হয় তার উপর নির্ভর করে — উচ্চতাকে সেন্টিমিটার থেকে মিটারে পাল্টালে covariance-এর সংখ্যাগত মান বদলে যায়, যদিও underlying সম্পর্ক একটুও বদলায়নি। Correlation covariance-কে থেকে -এর মধ্যে একটা ইউনিটবিহীন সংখ্যায় রিস্কেল করে এই সমস্যাটা ঠিক করে।
যেখানে: দুইটা স্ট্যান্ডার্ড ডেভিয়েশন দিয়ে ভাগ করলে ইউনিটগুলো সম্পূর্ণ ক্যানসেল হয়ে যায়, রেখে যায় আর -এর মধ্যে linear সম্পর্কের শক্তি আর দিকের একটা বিশুদ্ধ মাপ। এই নির্দিষ্ট ফর্মুলাটাকে বলা হয় Pearson correlation, Karl Pearson-এর নামে, আর এটাই "correlation" শব্দের ডিফল্ট মানে, যতক্ষণ না অন্যভাবে বলা হয়।
| বৈশিষ্ট্য | Covariance | Correlation |
|---|---|---|
| Range | ||
| X, Y-এর ইউনিটের উপর নির্ভরশীল? | হ্যাঁ | না — ইউনিটবিহীন, স্কেল-ইনভেরিয়ান্ট |
| ভিন্ন ভিন্ন ভ্যারিয়েবল পেয়ারের মধ্যে তুলনা করা যায়? | না — covariance 500 মানে শক্ত বা দুর্বল, ভ্যারিয়েবলগুলোর স্কেলের উপর নির্ভর করে | হ্যাঁ — correlation 0.9 সবসময় একই আপেক্ষিক শক্তি মানে, X আর Y যাই মাপুক না কেন |
| ফর্মুলা |
| ρ-এর মান | ব্যাখ্যা |
|---|---|
| নিখুঁত positive linear সম্পর্ক — X বাড়লে Y ঠিক linear ছন্দে বাড়ে | |
| শক্তিশালী positive linear সম্পর্ক | |
| মাঝারি positive linear সম্পর্ক | |
| কোনো linear সম্পর্ক নেই (তবু non-linearly সম্পর্কিত থাকতে পারে — সেকশন ৫.৪-এর সতর্কতা দেখো) | |
| মাঝারি negative linear সম্পর্ক | |
| শক্তিশালী negative linear সম্পর্ক | |
| নিখুঁত negative linear সম্পর্ক |
দুইটা random variable X আর Y-এর joint PMF টেবিল এডিট করো। টেবিল পাল্টানোর সাথে সাথে Cov(X,Y), correlation ρ, আর independence চেক সব একসাথে আপডেট হচ্ছে দেখো।
X and Y were generated with no relationship to each other. Edit any cell weight to explore other joint distributions.
Joint PMF — P(X = x, Y = y)
| X \ Y | 0 | 1 | P(X=x) |
|---|---|---|---|
| 0 | 0.150 | 0.100 | 0.250 |
| 1 | 0.300 | 0.200 | 0.500 |
| 2 | 0.150 | 0.100 | 0.250 |
| P(Y=y) | 0.600 | 0.400 | 1.000 |
Row X = 0
Row X = 1
Row X = 2
Conditional PMF — P(Y = y | X = x)
Y = 0
0.600
Y = 1
0.400
E[X]
1.000
E[Y]
0.400
Cov(X,Y)
0.000
Correlation
0.000
"Strongly dependent" প্রিসেট চেষ্টা করো আর তার correlation মান "Mild positive relationship" প্রিসেটের সাথে তুলনা করো — দুটোই positive, কিন্তু একটা 1-এর অনেক কাছাকাছি, যা দুইটা ভ্যারিয়েবল একসাথে কতটা টাইট হয়ে বদলাচ্ছে তার সাথে মেলে।
Correlation সম্পর্কে সবচেয়ে বেশি বলা (আর সবচেয়ে গুরুত্বপূর্ণ) সতর্কতা: একটা বেশি বলে দেয় আর একসাথে বদলানোর প্রবণতা দেখায়, একটা অন্যটার কারণ না। আইসক্রিম বিক্রি আর ডুবে মৃত্যুর ঘটনা positively correlated — আইসক্রিম ডুবে মৃত্যুর কারণ বলে না, বরং একটা তৃতীয় ভ্যারিয়েবল (গরম আবহাওয়া) দুটোকেই একসাথে বাড়িয়ে দেয় বলে। Correlation-কে causation হিসেবে ধরার আগে সবসময় জিজ্ঞেস করো একটা যুক্তিসঙ্গত causal গল্প আছে কি না, বা একটা লুকানো তৃতীয় ভ্যারিয়েবল দুটোকেই চালাচ্ছে কি না।
দুইটার বেশি random variable থাকলে — যেমন একটা random vector , একটা ডেটাসেটের ফিচারদের একটা row-এর মতো — তোমার একসাথে প্রতিটা পেয়ারওয়াইজ variance আর covariance লাগবে, একবারে একটা পেয়ার না। Covariance matrix এগুলো সব একটা গ্রিডে সংগঠিত করে।
যেখানে: -এর এন্ট্রি হলো — আর যেহেতু (সেকশন ৫.৪), ডায়াগোনাল এন্ট্রিগুলো প্রতিটা ভ্যারিয়েবলের নিজের variance-ই।
| বৈশিষ্ট্য | স্টেটমেন্ট | কেন সত্যি |
|---|---|---|
| Diagonal elements | Cov(X,X) = Var(X) (সেকশন ৫.৪) | |
| Off-diagonal elements | , -এর জন্য | দুইটা ভিন্ন ভ্যারিয়েবলের প্রতিটা পেয়ারওয়াইজ সম্পর্ক |
| Symmetric | Covariance সিমেট্রিক: Cov(X,Y) = Cov(Y,X) (সেকশন ৫.৪) | |
| Positive semi-definite | যেকোনো ভেক্টর -এর জন্য, | ঠিক -এর সমান — -গুলোর একটা linear combination-এর variance, আর variance কখনো negative হতে পারে না |
ফিচার সম্পর্ক
অফ-ডায়াগোনাল এন্ট্রিগুলো দ্রুত দেখলেই বোঝা যায় কোন কোন ফিচার পেয়ার একসাথে বদলায় — রিডানডেন্সি খুঁজে পাওয়ার শুরুর বিন্দু।
মাল্টিভ্যারিয়েট ডেটা
একের বেশি numeric কলামযুক্ত যেকোনো ডেটাসেটেরই একটা covariance matrix থাকে — এটাই একটা মাল্টিভ্যারিয়েট distribution-এর spread-এর স্ট্যান্ডার্ড সামারি।
PCA
Principal Component Analysis covariance matrix-এর eigenvector খুঁজে বের করে — যে দিকগুলোতে ডেটা সবচেয়ে বেশি ভ্যারি করে, dimensionality কমানোর সময় সবচেয়ে ইনফরমেটিভ spread ধরে রাখতে ব্যবহৃত হয়।
Gaussian মডেল
মাল্টিভ্যারিয়েট Normal distribution সম্পূর্ণভাবে সংজ্ঞায়িত হয় শুধু একটা mean vector আর একটা covariance matrix দিয়ে — Σ পুরো ঘণ্টা-আকৃতির ক্লাউডের শেপ, দিক, আর spread নিয়ন্ত্রণ করে।
Dimensionality reduction
ফিচারগুলোর মধ্যে বড় covariance মানে কিছু কলাম কম সংখ্যক underlying dimension দিয়ে সামারাইজ করা যেতে পারে — PCA আর সম্পর্কিত টেকনিকের মূল মোটিভেশন।
সেকশন ২ আর ৩ একটা কভার করেছে; এই সেকশনে expectation আর variance-এর নিয়মগুলো কয়েকটা random variable-এর যোগফলের জন্য সম্প্রসারিত করা হবে, যেখানে covariance আবার একটা correction টার্ম হিসেবে ফিরে আসে।
Expectation dependence থাকুক বা না থাকুক linear থাকে (সেকশন ২.৪) — এখানে নতুন কিছু নেই। Variance-ই সেই জায়গা যেখানে dependence সরাসরি ম্যাটার করা শুরু করে:
যেখানে: Expectation-এর মতো না, variance একটা অতিরিক্ত correction টার্ম পায় — আর -এর মধ্যেকার covariance-এর দ্বিগুণ — যা শুধু তখনই হারিয়ে যায় যখন আর uncorrelated (), যা independent ভ্যারিয়েবলরা সবসময়ই।
লক্ষ্য করো বিয়োগের জন্য চিহ্নটা উল্টে যায়, কিন্তু covariance টার্মটা এখনো ম্যাগনিচিউডে যোগ হয় — একটা positively-correlated বিয়োগ করলে combined variance কমে যায় (তারা একসাথে বদলাতে চায়, তাই তাদের পার্থক্যগুলো আংশিকভাবে ক্যানসেল হয়), যেখানে negatively-correlated বিয়োগ করলে variance বাড়ে।
আর independent হলে, , আর উপরের দুইটা ফর্মুলাই -এ পরিণত হয় — variance শুধু independent ক্ষেত্রেই "additive" হয়ে যায়, যে কারণে স্ট্যাটিসটিক্সের অনেক ফলাফল (যেমন বেশি independent স্যাম্পলের সাথে sample mean-এর variance কমে যাওয়া) independence অ্যাসাম্পশনের উপর নির্ভর করে।
সাধারণ linear combination -এর জন্য:
এটাই সেই সাধারণ প্যাটার্ন যা covariance matrix (সেকশন ৭) একসাথে অনেক ভ্যারিয়েবলের জন্য প্যাকেজ করে: ।
Conditional expectation, লেখা হয়, হলো -এর expected value যখন তুমি আগে থেকেই জানো একটা নির্দিষ্ট মান নিয়েছে — দেওয়া থাকলে -এর conditional distribution (আগের চ্যাপ্টারের সেকশন ১৩) ব্যবহার করে হিসাব করা expectation, -এর unconditional distribution না।
ব্যাখ্যা। -কে তার পুরো distribution জুড়ে গড় না করে, তুমি শুধু সেই "স্লাইস"-এর ফলাফলগুলোর উপর গড় করছো যেখানে ঠিক -এর সমান হয় — কন্ডিশনাল প্রোবাবিলিটির পেছনের একই সংকোচনের আইডিয়া, এখন একটা একক ইভেন্টের প্রোবাবিলিটির বদলে একটা গড়ের উপর প্রয়োগ করা হচ্ছে।
Conditional mean একটা -এর ফাংশন হিসেবে। যখন তুমি -কে একটা নির্দিষ্ট মানে ফিক্স না করে -কে এমন একটা নিয়ম হিসেবে ধরো যা -এর যেকোনো মান ইনপুট নিতে পারে, তখন এটা নিজেই একটা random variable হয়ে যায় — এমন একটা যা শেষ পর্যন্ত কী হয় তার উপর নির্ভর করে। এই অবজেক্টটাই, , ঠিক যার উপর পরবর্তী দুইটা সেকশন গড়ে ওঠে।
ML-এ conditional expectation। একটা রিগ্রেশন মডেলের ইনপুট ফিচার দেওয়া থাকলে তার প্রেডিকশন , আদর্শ ক্ষেত্রে, -এর একটা অনুমান — মডেলটা টার্গেটের conditional mean শিখতে চেষ্টা করছে, ইনপুট দেওয়া থাকলে। এই কারণেই mean squared error মিনিমাইজ করলে এমন প্রেডিকশন পাওয়া যায় যা একটা conditional expectation-এর কাছাকাছি চলে যায়।
কখনো কখনো তুমি প্রতিটা সম্ভাব্য -এর জন্য জানো, কিন্তু আসলে চাও প্লেইন, unconditional । Law of Total Expectation দুটোকে সংযুক্ত করে:
যেখানে: -এর সামগ্রিক expectation হলো conditional expectation -গুলোর একটা weighted average, প্রতিটা কতটা সম্ভাব্য তা দিয়ে ওজন দেওয়া — একটা গড়ের গড়, কিন্তু প্রতিবার ভিন্ন একটা ভ্যারিয়েবল জুড়ে।
Partition-ভিত্তিক ব্যাখ্যা। -এর সম্ভাব্য মানগুলোকে sample space-কে ছোট ছোট নন-ওভারল্যাপিং গ্রুপে (একটা partition) ভাগ করার মতো ভাবো। -এর সামগ্রিক গড় বের করতে, প্রতিটা গ্রুপের ভেতরে -এর গড় বের করো, তারপর সেই গ্রুপ-গড়গুলো একত্র করো, প্রতিটা গ্রুপ কতটা বড় (সম্ভাব্য) সেই অনুযায়ী ওজন দিয়ে — ঠিক যেভাবে একটা স্কুলের সামগ্রিক গড় পরীক্ষার নম্বর বের করা হয় প্রতিটা ক্লাসের গড় নম্বর থেকে, ক্লাসের সাইজ দিয়ে ওজন দিয়ে।
সহজ উদাহরণ। একটা ফ্যাক্টরিতে দুইটা মেশিন আছে। মেশিন A ৬০% ইউনিট বানায়, প্রতি ১০০ ইউনিটে গড়ে ২টা ডিফেক্ট নিয়ে। মেশিন B ৪০% ইউনিট বানায়, প্রতি ১০০ ইউনিটে গড়ে ৫টা ডিফেক্ট নিয়ে। সামগ্রিক গড় ডিফেক্ট রেট:
কন্ডিশনাল প্রোবাবিলিটির সাথে সম্পর্ক। এটা ঠিক কন্ডিশনাল প্রোবাবিলিটি চ্যাপ্টার-এর Law of Total Probability-এর সাথে একই "কেসে ভাগ করে, তারপর একত্র করো" যুক্তি — শুধু এখন একটা expected value-এর উপর প্রয়োগ করা হচ্ছে, একটা একক ইভেন্টের প্রোবাবিলিটির বদলে।
Variance-এরও একই আইডিয়ার নিজস্ব একটা সংস্করণ আছে, কিন্তু একটার বদলে দুইটা অংশ লাগে, কারণ সামগ্রিক spread দুইটা ভিন্ন উৎস থেকে আসে: প্রতিটা গ্রুপের ভেতরে কতটা ভ্যারি করে (একবার তুমি জেনে গেলে কোন গ্রুপ / -এর কোন মান), আর গ্রুপ গড়গুলো নিজেরাই একটা গ্রুপ থেকে আরেকটায় কতটা ভ্যারি করে।
যেখানে: প্রথম টার্মটা প্রতিটা গ্রুপের নিজের ভেতরের spread-এর গড় নেয়; দ্বিতীয় টার্মটা মাপে গ্রুপ গড়গুলো নিজেরা কতটা দোলে, পাল্টানোর সাথে সাথে।
ব্যাখ্যা। প্রতিটা আলাদা গ্রুপের নিজের ভেতরের variance কম হলেও (একটা গ্রুপের ভেতরে সবাই একে অপরের মতো), সামগ্রিক variance এখনো অনেক বড় হতে পারে যদি গ্রুপগুলোর গড় একে অপরের থেকে অনেক আলাদা হয় — আর Law of Total Variance ঠিক সেই ফর্মুলা যেটা মোট spread-কে পরিষ্কারভাবে "গ্রুপের ভেতরের spread" আর "গ্রুপ-গড়ের মধ্যেকার spread"-এ ভাগ করে, কিছুই দুইবার গোনা হয় না বা বাদ পড়ে না।
| Distribution | Mean E[X] | Variance Var(X) |
|---|---|---|
| Bernoulli(p) | ||
| Binomial(n, p) | ||
| Poisson(λ) | ||
| Uniform(a, b) — continuous | ||
| Normal(μ, σ²) | ||
| Exponential(λ) |
একটা দ্রুত sanity-check প্যাটার্ন মনে রাখার মতো: একটা Binomial(n, p), যা টা independent Bernoulli(p) ট্রায়াল একসাথে যোগ করা মাত্র, তার mean আর variance দুটোই দিয়ে স্কেল হয় — আর — যোগফলের উপর expectation আর (independent) variance দুটোই additive হওয়ার (সেকশন ২.৪ আর ৮) সরাসরি ফলাফল।
একটা মডেলের loss ফাংশন, ডেটা-জেনারেটিং distribution জুড়ে গড় করলে, আক্ষরিক অর্থেই একটা expectation। একটা রিগ্রেশন মডেলকে mean squared error মিনিমাইজ করে ট্রেইন করা হলো, formally, এটার একটা অনুমান মিনিমাইজ করা:
— যা ঠিক variance-এর সংজ্ঞা (সেকশন ৩.৩), শুধু একটা raw random variable-এর বদলে প্রেডিকশন এরর -এর উপর প্রয়োগ করা। এই কারণেই MSE আর variance-এর একই গাণিতিক DNA আছে: দুটোই "expected squared deviation," শুধু ভিন্ন রাশির।
একটা মডেল (bias-variance অর্থে, সেকশন ১৫) high variance রাখে, যদি এর প্রেডিকশনগুলো কোন নির্দিষ্ট ট্রেনিং সেট দেখেছে তার উপর নির্ভর করে হঠাৎ করে দুলতে থাকে — একই মডেল আর্কিটেকচারকে একই জনসংখ্যা থেকে দুইটা ভিন্ন র্যান্ডম স্যাম্পলে ট্রেইন করলে, একটা high-variance মডেল প্রতিবার লক্ষণীয়ভাবে ভিন্ন প্রেডিকশন দেয়। এটা আক্ষরিক অর্থেই এই চ্যাপ্টারের variance, একটা random variable-এর ভিন্ন ভিন্ন মানের বদলে ট্রেনিং ডেটার ভিন্ন ভিন্ন র্যান্ডম ড্র জুড়ে মাপা।
একটা মডেলের expected risk হলো তার loss ফাংশনের expectation, পুরো আসল ডেটা distribution জুড়ে (শুধু তোমার হাতে থাকা সীমিত ট্রেনিং স্যাম্পল না):
যেহেতু তুমি কখনো পুরো আসল distribution সরাসরি পর্যবেক্ষণ করতে পারবে না, প্র্যাকটিসে তুমি empirical risk (তোমার আসল ট্রেনিং ডেটার উপর গড় loss) মিনিমাইজ করো একটা বিকল্প হিসেবে, আর আশা করো এটা আসল expected risk-এর একটা ভালো অনুমান — empirical আর expected risk-এর মধ্যেকার এই ফাঁকটাই generalization theory-তে বারবার ফিরে আসা একটা থিম।
একটা ডেটাসেটের প্রতিটা ফিচার পেয়ারের জন্য (বা, আরো কাজের, correlation ) হিসাব করা exploratory data analysis-এর একটা স্ট্যান্ডার্ড প্রথম ধাপ। দুইটা ফিচারের মধ্যে খুব বেশি redundancy-এর সংকেত দেয় — দুইটা কলাম বেশিরভাগ ওভারল্যাপিং তথ্য বহন করছে, আর একটা মডেলের হয়তো দুটোই দরকার না।
যখন কয়েকটা ফিচার একে অপরের সাথে খুব বেশি correlated, একটা মডেল (বিশেষ করে linear regression) সমস্যায় পড়তে পারে: প্রতিটা correlated ফিচারের আলাদা অবদান নির্দিষ্ট করা কঠিন হয়ে যায়, coefficient অনুমানগুলো অস্থির হয়ে পড়ে, আর ডেটার ছোট পরিবর্তনেও সেগুলো হঠাৎ অনেক বদলে যেতে পারে। এই সমস্যাটাকে বলা হয় multicollinearity, আর এটা সরাসরি ফিচার covariance/correlation matrix (সেকশন ৭) থেকে ডায়াগনোজ করা হয়।
Principal Component Analysis (PCA) একটা ডেটাসেটের covariance matrix -এর (সেকশন ৭) উপর সরাসরি কাজ করে: এটা -এর eigenvector খুঁজে বের করে, যা ডেটা সবচেয়ে বেশি ভ্যারি করার দিক নির্দেশ করে, আর eigenvalue, যা বলে দেয় ঠিক কতটা variance সেই প্রতিটা দিক জুড়ে আছে। ডেটাকে শীর্ষ কয়েকটা eigenvector-এ প্রজেক্ট করলে অরিজিনাল variance-এর বেশিরভাগ ধরে রাখা যায়, সবচেয়ে কম অবদান রাখা dimension-গুলো বাদ দিয়ে — পুরো এই টেকনিকটা, মূলত, covariance-এর একটা অ্যাপ্লিকেশন।
একটা মাল্টিভ্যারিয়েট Normal (Gaussian) distribution সম্পূর্ণভাবে দুইটা জিনিস দিয়ে নির্দিষ্ট করা হয়: একটা mean vector আর একটা covariance matrix। প্রতিটা Gaussian-ভিত্তিক মডেল — Gaussian Naive Bayes থেকে Gaussian Mixture Model থেকে Gaussian Process পর্যন্ত — সরাসরি covariance matrix-এর উপর নির্ভর করে তার ভ্যারিয়েবলগুলো একে অপরের সাথে কীভাবে সম্পর্কিত তা বর্ণনা করতে।
একটা মডেলের মোট expected prediction error তিনটা আলাদা অংশে ভাগ করা যায়:
যেখানে: Bias হলো মডেলের গড় প্রেডিকশন (অনেক সম্ভাব্য ট্রেনিং সেট জুড়ে) আসল মান থেকে কতটা দূরে বসে; Variance হলো মডেলের প্রেডিকশন সেই ভিন্ন ভিন্ন ট্রেনিং সেট জুড়ে কতটা দোলে (সেকশন ১৩); আর হলো ডেটার নিজের ভেতরে থাকা নয়েজ যা কোনো মডেলই কখনো সরাতে পারবে না।
| Underfitting (high bias) | Overfitting (high variance) | |
|---|---|---|
| মডেল কমপ্লেক্সিটি | আসল প্যাটার্নের জন্য খুব সহজ | খুব কমপ্লেক্স — নয়েজ ফিট করে, শুধু সিগন্যাল না |
| ট্রেনিং error | বেশি — ট্রেনিং ডেটাও ভালোভাবে ফিট হয় না | কম — প্রায়ই প্রায় নিখুঁতভাবে ফিট হয় |
| টেস্ট error | বেশি | বেশি — কম ট্রেনিং error থাকা সত্ত্বেও |
| ট্রেনিং সেট পরিবর্তনের প্রতি সংবেদনশীলতা | কম — একটা সহজ মডেল ভিন্ন ট্রেনিং সেট জুড়ে খুব কমই বদলায় | বেশি — ট্রেনিং সেটের ছোট পরিবর্তনেও প্রেডিকশন উল্লেখযোগ্যভাবে দোলে |
| সমাধান | মডেল কমপ্লেক্সিটি বাড়াও / ফিচার যোগ করো | কমপ্লেক্সিটি কমাও, রেগুলারাইজ করো, বা আরো ট্রেনিং ডেটা যোগ করো |
High bias আর high variance দুটোই খারাপ পারফরম্যান্স তৈরি করে, কিন্তু সম্পূর্ণ বিপরীত সমাধান দাবি করে। আরো ট্রেনিং ডেটা যোগ করলে একটা high-variance (overfitting) মডেলকে উল্লেখযোগ্যভাবে সাহায্য করে, কিন্তু একটা high-bias (underfitting) মডেলের জন্য প্রায় কিছুই করে না — একটা সিস্টেমেটিকভাবে খুব সহজ মডেল যতই ডেটা দেখুক, সিস্টেমেটিকভাবে ভুলই থাকে। কোনটার মুখোমুখি হচ্ছো তা ডায়াগনোজ করা (সাধারণত training বনাম validation error তুলনা করে) সমাধান বেছে নেওয়ার আগেই করতে হবে।
PMF থেকে expected value হিসাব করা। একটা ডাইস এমনভাবে লোড করা যে আর – প্রতিটার probability । — fair ডাইসের 3.5 থেকে টেনে উপরে তোলা হয়েছে, 6-এর ভারী ওজনের কারণে।
PDF থেকে expected value হিসাব করা। , -এর জন্য: ।
Variance আর standard deviation হিসাব করা। উপরের লোড করা ডাইসের জন্য, । , তাই ।
Covariance আর correlation হিসাব করা। ধরো , , আর । তাহলে — একটা মাঝারি positive linear সম্পর্ক।
Covariance matrix তৈরি আর ইন্টারপ্রেট করা। তিনটা ফিচারের জন্য , , , , , :
আর একসাথে বদলায় (positive covariance); আর কোনো linear সম্পর্ক দেখায় না (zero); আর একটু বিপরীত দিকে বদলায় (negative)।
Bias আর variance বিশ্লেষণ করা। স্পষ্টভাবে বাঁকা ডেটায় ফিট করা degree 1-এর polynomial regression (একটা সরলরেখা) উচ্চ ট্রেনিং error আর উচ্চ টেস্ট error দেখাবে, প্রায় সমান — high bias। একই ডেটায় degree-15 polynomial দিয়ে ফিট করলে প্রায়-শূন্য ট্রেনিং error কিন্তু উচ্চ টেস্ট error দেখাবে — high variance। কোনোটাই সঠিক কমপ্লেক্সিটি না; সেকশন ১৫-এর sweet spot দুটোর মাঝামাঝি কোথাও।
১. Expectation। একটা স্পিনার 1, 2, বা 3-তে থামে probability 0.2, 0.3, 0.5 দিয়ে। বের করো।
সমাধান: ।
২. Variance। প্রবলেম ১ ব্যবহার করে বের করো।
সমাধান: । ।
৩. Standard Deviation। প্রবলেম ২ ব্যবহার করে বের করো।
সমাধান: ।
৪. Covariance। Joint PMF: । বের করো।
সমাধান: । । । ।
৫. Correlation। প্রবলেম ৪ ব্যবহার করে, আর দিয়ে, বের করো।
সমাধান: — একটা দুর্বল positive linear সম্পর্ক।
৬. একাধিক Random Variable। যদি , , , আর বের করো।
সমাধান: । ।
৭. Covariance Matrix। , , দেওয়া থাকলে, covariance matrix লেখো।
সমাধান: ।
৮. Feature Covariance। দুইটা ফিচারের , , । এরা কি শক্তভাবে correlated?
সমাধান: — হ্যাঁ, শক্তভাবে correlated, আর redundancy-এর একটা প্রার্থী।
৯. Expected Loss। একটা মডেল প্রেডিক্ট করে; আসল probability 0.6-এ 8, আর probability 0.4-এ 14। Expected squared error বের করো।
সমাধান: ।
১০. Model Variance। একটা মডেল ৩টা ভিন্ন র্যান্ডম স্যাম্পলে ট্রেইন করে একই ইনপুটের জন্য 5.1, 4.9, আর 5.0 প্রেডিক্ট করে। প্রেডিকশন variance অনুমান করো (এগুলোকে সমান সম্ভাব্য ফলাফল ধরে নাও)।
সমাধান: গড় । — কম variance, স্যাম্পলগুলো জুড়ে একটা স্থিতিশীল মডেল।
Expectation
একটা distribution-এর probability-weighted কেন্দ্র, আর তার linearity।
Variance আর Standard Deviation
সেই কেন্দ্রের চারপাশে spread মাপো, আর আসল ইউনিটে ফিরিয়ে বলো।
Moment আর Shape
দেখো উচ্চতর moment কীভাবে skew আর টেইল-ওজন বর্ণনা করে।
Covariance
spread-কে দুইটা ভ্যারিয়েবলে সম্প্রসারিত করো — তারা কি একসাথে বদলায়?
Correlation
Covariance-কে তুলনাযোগ্য, ইউনিটবিহীন সংখ্যায় রিস্কেল করো।
Covariance Matrix
একসাথে অনেক ভ্যারিয়েবলের প্রতিটা পেয়ারওয়াইজ variance আর covariance প্যাকেজ করো।
একাধিক ভ্যারিয়েবল আর Conditioning
যোগফল জুড়ে variance একত্র করো, আর জানা তথ্যের উপর কন্ডিশন করো।
সাধারণ Distribution
Bernoulli, Binomial, Poisson, Normal, আর আরো অনেকের উপর ফর্মুলাগুলো প্রয়োগ করা দেখো।
Bias-Variance Tradeoff
দেখো expectation আর variance মডেল error বিশ্লেষণের কেন্দ্রে আবার ফিরে আসছে।