Chapter 5 of 7
The catalog of shapes randomness takes, and how to pick the right one
Random Variables চ্যাপ্টারে তুমি শিখেছো কীভাবে একটা অনিশ্চিত ফলাফলকে সংখ্যায় রূপান্তর করতে হয়, । কিন্তু যে একটা সংখ্যা সেটা জানাই যথেষ্ট না — তোমার আরও জানা দরকার -এর প্রতিটা সম্ভাব্য মান কতটা সম্ভব। এই চ্যাপ্টার ঠিক এটা নিয়েই — বারবার, সম্পূর্ণ ভিন্ন ভিন্ন বাস্তব পরিস্থিতিতে, "কতটা সম্ভব" যেসব স্ট্যান্ডার্ড শেপ ধারণ করে, তার একটা ক্যাটালগ।
একটা প্রোবাবিলিটি ডিস্ট্রিবিউশন হলো একটা সম্পূর্ণ বর্ণনা — মোট প্রোবাবিলিটি, ১, একটা র্যান্ডম ভেরিয়েবলের সব সম্ভাব্য মানের মধ্যে কীভাবে ছড়িয়ে আছে। -এর যেকোনো সম্ভাব্য মান (বা মানের রেঞ্জ) দাও, এটা তোমাকে বলে দেবে সেটা ঠিক কতটা সম্ভব। এটা একটা একক সংখ্যা না — এটা পুরো নিয়মকানুনের বই, যা একসাথে সব ফলাফল কভার করে।
একটা প্রোবাবিলিটি ডিস্ট্রিবিউশন X-এর প্রতিটা সম্ভাব্য মানের জন্য একই প্রশ্নের উত্তর দেয়: "এটা কতটা সম্ভব?"
এটাকে ভাবতে পারো একটা র্যান্ডম ভেরিয়েবলকে প্রোবাবিলিটির একটা ল্যান্ডস্কেপে রূপান্তরের রেসিপি হিসেবে — কোথাও উঁচু (সম্ভাব্য মান), কোথাও চ্যাপ্টা (অসম্ভাব্য মান), কিন্তু পুরো ল্যান্ডস্কেপ জুড়ে যোগফল (বা ইন্টিগ্রাল) সবসময় ঠিক ১।
ডিস্ট্রিবিউশন ছাড়া, "র্যান্ডম" শুধু একটা অস্পষ্ট শব্দ — তুমি জানো ফলাফল ফিক্সড না, কিন্তু এর বেশি কিছু নির্দিষ্টভাবে বলতে পারো না। ডিস্ট্রিবিউশন থাকলে, র্যান্ডমনেস এমন কিছুতে পরিণত হয় যা দিয়ে তুমি হিসাব করতে পারো: একটা রেঞ্জ ফলাফলের প্রোবাবিলিটি বের করতে পারো, বহুবার রিপিট করলে গড়ে কী আশা করা উচিত সেটা বের করতে পারো, ফলাফলগুলো সাধারণত কতটা ছড়ানো সেটা বুঝতে পারো, এবং যেকোনো নির্দিষ্ট রেজাল্ট দেখে কতটা অবাক হওয়া উচিত সেটাও বুঝতে পারো।
এই কারণেই ডিস্ট্রিবিউশন সব জায়গায় দেখা যায় যেখানেই কোয়ান্টিটেটিভ কাজ অনিশ্চয়তার সাথে জড়িত — কোয়ালিটি কন্ট্রোল (একটা ব্যাচে কতগুলো ডিফেক্টিভ আইটেম?), ফাইন্যান্স (কালকে একটা স্টক কতটা মুভ করতে পারে?), বায়োলজি (একজন র্যান্ডম বাছাই করা অ্যাডাল্ট কত লম্বা?), আর, এই চ্যাপ্টার বারবার যেখানে ফিরে আসবে, মেশিন লার্নিং (তোমার ডেটায় "নয়েজ" আসলে কেমন দেখায়, আর একটা মডেলের কী অ্যাসাম্প্শন নেওয়া উচিত?)।
এই দুইটা আইডিয়া একসাথে গুলিয়ে ফেলা সহজ, কিন্তু এরা আলাদা প্রশ্নের উত্তর দেয়:
| কনসেপ্ট | এটা কী | উদাহরণ |
|---|---|---|
| র্যান্ডম ভেরিয়েবল | একটা র্যান্ডম প্রসেসের প্রতিটা ফলাফলকে একটা সংখ্যা দেওয়ার নিয়ম | X = ৩টা কয়েন টসে হেডসের সংখ্যা |
| প্রোবাবিলিটি ডিস্ট্রিবিউশন | X যেসব মান নিতে পারে তার প্রতিটার সাথে যুক্ত প্রোবাবিলিটির পুরো সেট | P(X=0)=1/8, P(X=1)=3/8, P(X=2)=3/8, P(X=3)=1/8 |
ডিস্ট্রিবিউশন ছাড়া একটা র্যান্ডম ভেরিয়েবল একটা অসম্পূর্ণ বাক্যের মতো — তুমি জানো কী মাপা হচ্ছে, কিন্তু জানো না মাপগুলো সাধারণত কেমন আসবে।
প্রতিটা প্রোবাবিলিটি ডিস্ট্রিবিউশন দুইটা বড় পরিবারের একটাতে পড়ে, আর কোনটাতে পড়বে সেটা পুরোপুরি নির্ভর করে তুমি কোন ধরনের র্যান্ডম ভেরিয়েবল বর্ণনা করছো তার উপর:
এই চ্যাপ্টারের সেকশন ২–৮ ডিসক্রিট ডিস্ট্রিবিউশন নিয়ে গভীরভাবে আলোচনা করে; সেকশন ৯–১৭ কন্টিনিউয়াসগুলো নিয়ে। এই পার্থক্যটা খুব গুরুত্বপূর্ণ কারণ এটা ঠিক করে দেয় প্রতিটার সাথে কীভাবে প্রোবাবিলিটি হিসাব করবে — সেকশন ২ আর ৯ ঠিক কেন সেটা বিস্তারিত বলে।
ডিস্ট্রিবিউশন শুধু একটা স্ট্যাটিস্টিক্স টপিক না যেটা ML-এর প্রিরিকুইজিট হয়ে গেছে — এগুলো সরাসরি বেক করা আছে কীভাবে মডেল তৈরি আর ট্রেইন করা হয় তার মধ্যে। একটা ক্লাসিফায়ারের আউটপুট লেয়ার (softmax) ক্লাস লেবেলের উপর একটা প্রোবাবিলিটি ডিস্ট্রিবিউশন তৈরি করে। একটা রিগ্রেশন মডেলের এরর টার্মকে সাধারণত Normal ডিস্ট্রিবিউশন অনুসরণ করছে ধরে নেওয়া হয়, আর এই অ্যাসাম্প্শনটাই স্কয়ার্ড এররকে loss function হিসেবে ব্যবহার করার জাস্টিফিকেশন দেয়। একটা Naive Bayes ক্লাসিফায়ার পুরোপুরি অ্যাসাম্ড ফিচার ডিস্ট্রিবিউশন দিয়ে তৈরি। বেয়েসিয়ান মেশিন লার্নিং মডেলের প্যারামিটারগুলোকেই র্যান্ডম ভেরিয়েবল হিসেবে ট্রিট করে, তাদের নিজস্ব ডিস্ট্রিবিউশন সহ। এই চ্যাপ্টারের শেষে, এই প্রতিটা বাক্যই কংক্রিট, হিসাবযোগ্য অর্থ পাবে।
যেকোনো ডিস্ট্রিবিউশন দেখলে, জিজ্ঞেস করার মতো কয়েকটা স্ট্যান্ডার্ড প্রশ্ন আছে, আর এই চ্যাপ্টার প্রতিটা কভার করা ডিস্ট্রিবিউশনের জন্য এই প্রতিটা প্রশ্নের উত্তর দেওয়ার টুল তৈরি করে:
শেপ
এটা সিমেট্রিক, স্কিউড, পিকড, নাকি ফ্ল্যাট? কোথায় প্রোবাবিলিটি কেন্দ্রীভূত সেটার একটা দ্রুত ভিজ্যুয়াল সামারি।
সেন্টার
মিন (এক্সপেক্টেড ভ্যালু) — র্যান্ডম প্রসেসটা অসীমবার রিপিট করলে লং-রান গড় রেজাল্ট।
স্প্রেড
ভ্যারিয়েন্স আর স্ট্যান্ডার্ড ডেভিয়েশন — সাধারণ ফলাফল সেন্টার থেকে কতদূর সরে যায়।
সাপোর্ট
ভেরিয়েবল আসলে যে মানগুলো নিতে পারে — যেমন কয়েন ফ্লিপের জন্য {0,1}, বা অপেক্ষার সময়ের জন্য সব পজিটিভ সংখ্যা।
প্যারামিটার
অল্প কয়েকটা মান (যেমন n আর p, বা μ আর σ) যা একটা ফ্যামিলির মধ্যে একটা নির্দিষ্ট ডিস্ট্রিবিউশনকে পুরোপুরি ঠিক করে দেয়।
একটা ডিসক্রিট ডিস্ট্রিবিউশন এমন একটা র্যান্ডম ভেরিয়েবল নিয়ন্ত্রণ করে যা একটা ফাইনাইট বা কাউন্টেবলি ইনফাইনাইট আলাদা আলাদা মানের সেট নেয় — দুইটা পাশাপাশি মানের "মাঝামাঝি" কখনো কিছু হয় না। তুমি সম্ভাব্য প্রতিটা ফলাফল লিস্ট করতে পারো, অন্তত নীতিগতভাবে, যদিও লিস্টটা ইনফাইনাইট হতে পারে (যেমন "0, 1, 2, 3, ... চিরকাল")।
যে ফাংশন একটা ডিসক্রিট র্যান্ডম ভেরিয়েবলের প্রতিটা আলাদা মানকে একটা প্রোবাবিলিটি অ্যাসাইন করে, তাকে বলে প্রোবাবিলিটি ম্যাস ফাংশন, বা PMF, লেখা হয় বা । এর কন্টিনিউয়াস কাউন্টারপার্টের (সেকশন ৯) থেকে ভিন্ন, PMF একটা একক নির্দিষ্ট পয়েন্টের জন্য একটা আসল, অর্থপূর্ণ প্রোবাবিলিটি দেয় — একটা ডিসক্রিট ভেরিয়েবলের জন্য আসল, নন-জিরো সংখ্যা, শূন্য না।
যেখানে:
প্রতিটা ডিসক্রিট ডিস্ট্রিবিউশনকে কিউমুলেটিভ ডিস্ট্রিবিউশন ফাংশন (CDF) দিয়েও বর্ণনা করা যায়, , যা পর্যন্ত (অন্তর্ভুক্ত) প্রতিটা মানের PMF যোগ করে। CDF সবসময় ০-এর কাছাকাছি শুরু হয়, ধাপে ধাপে উপরে ওঠে (কখনো নিচে নামে না), আর বড় হওয়ার সাথে সাথে ১-এর দিকে এগোয় — প্রতিটা উপরে ওঠার ধাপের উচ্চতা ঠিক সেই মানের PMF-এর সমান।
একটা ডিসক্রিট ভেরিয়েবলের জন্য মানের একটা রেঞ্জ-এর প্রোবাবিলিটি বের করতে, সেই রেঞ্জের প্রতিটা মানের PMF যোগ করো:
উদাহরণ। একটা fair ছয়-পিঠের ডাইস রোল করা হলো, = ফলাফল। প্রতিটা -এর জন্য । তাহলে ।
যেখানে:
নিচের এক্সপ্লোরারটা নিয়ে খেলো — যেকোনো ফলাফলের ওয়েট টেনে দেখো PMF কীভাবে রিনরমালাইজ হয়, CDF আপডেট হয়, আর আর লাইভ রিক্যালকুলেট হয়। এটাই সেই মেকানিজম যা দিয়ে সেকশন ৩–৮-এর প্রতিটা ডিসক্রিট ডিস্ট্রিবিউশন তৈরি।
ফলাফলের ওয়েট বদলাও আর চারটা প্রিসেট সিনারিওতে PMF, CDF, মিন, ভ্যারিয়েন্স লাইভ দেখো।
X = result of one fair six-sided die. Drag any bar's weight below — the PMF renormalizes live.
PMF — P(X = x)
Sum of all bars = 1.000 (a valid PMF always sums to 1)
CDF — F(x) = P(X ≤ x)
F(x) climbs from 0 toward 1 and never decreases — each step's height equals that x's PMF value.
Adjust weights
E[X]
3.500
E[X²]
15.167
Var(X)
2.917
SD(X)
1.708
বার্নোলি ডিস্ট্রিবিউশন হলো সবচেয়ে সিম্পল প্রোবাবিলিটি ডিস্ট্রিবিউশন: এটা একটা একক র্যান্ডম এক্সপেরিমেন্ট বর্ণনা করে যার ঠিক দুইটা সম্ভাব্য ফলাফল আছে, প্রথাগতভাবে "সাকসেস" (1) আর "ফেইলিউর" (0) বলা হয়। এই চ্যাপ্টারের প্রায় প্রতিটা অন্য ডিসক্রিট ডিস্ট্রিবিউশন অনেকগুলো বার্নোলি ট্রায়াল একসাথে জুড়ে তৈরি।
একটা বার্নোলি ট্রায়াল হলো এই দুই-ফলাফলের এক্সপেরিমেন্টের একটা ইনস্ট্যান্স: একটা কয়েন ফ্লিপ, একটা পাস/ফেইল টেস্ট, একটা ক্লিক/নো-ক্লিক ইভেন্ট, একটা সঠিক/ভুলভাবে ক্লাসিফাই হওয়া এক্সাম্পল।
প্রথা অনুযায়ী, মানে "সাকসেস" আর মানে "ফেইলিউর" — এই লেবেলগুলো নির্বিচারে (arbitrary), "সাকসেস" মানে ভালো কিছু বোঝায় না; একটা "সাকসেস"কে ঠিক ততটাই সহজে "রোগী পজিটিভ টেস্ট" বা "পার্টটা ডিফেক্টিভ" হিসেবে ডিফাইন করা যায়।
এই ডিস্ট্রিবিউশনের ঠিক একটা প্যারামিটার আছে, , সাকসেসের প্রোবাবিলিটি, যেখানে । ডিস্ট্রিবিউশনের শেপ, মিন, ভ্যারিয়েন্স — সবকিছু এই একটা মাত্র সংখ্যা দিয়ে পুরোপুরি ঠিক হয়ে যায়।
সমতুল্যভাবে, সরাসরি লিখলে: আর । কম্প্যাক্ট এক্সপোনেন্ট ফর্মটা শুধু দুইটা কেস এক লাইনে লেখার একটা ট্রিক — বা বসিয়ে দেখো, এটা সহজ উত্তরেই এসে পড়ে।
একটা বার্নোলি ভেরিয়েবলের মিন হলো শুধু তার সাকসেস প্রোবাবিলিটি — যুক্তিসঙ্গত, কারণ 0 আর 1-এর একটা লম্বা রানের গড় বের করলে ঠিক 1-এর যে ভগ্নাংশ পাবে, সেটাই সংজ্ঞা অনুযায়ী ।
ভ্যারিয়েন্স সবচেয়ে বেশি -এ (ফলাফল নিয়ে সবচেয়ে বেশি অনিশ্চয়তা) আর 0 বা 1-এর কাছাকাছি গেলে সংকুচিত হয় (ফলাফল যেকোনো দিকেই প্রায় নিশ্চিত হয়ে যায়)।
একটা বাইনারি ক্লাসিফায়ারের টার্গেট লেবেল — স্প্যাম/নট স্প্যাম, ফ্রড/নট ফ্রড, ম্যালিগন্যান্ট/বিনাইন — স্বাভাবিকভাবেই একটা বার্নোলি র্যান্ডম ভেরিয়েবল হিসেবে মডেল করা হয়। মডেলের কাজ হলো প্রতিটা নতুন ইনপুটের জন্য "1" ক্লাসের প্রোবাবিলিটি এস্টিমেট করা।
ডেটাসেটের যেকোনো হ্যাঁ/না ইভেন্ট — ইউজার ক্লিক করেছে কিনা, লোন ডিফল্ট হয়েছে কিনা, রোগী সুস্থ হয়েছে কিনা — একটা বার্নোলি ভেরিয়েবল, আর "হ্যাঁ" ফলাফলের স্যাম্পল প্রোপোরশনই -এর স্ট্যান্ডার্ড এস্টিমেট।
বাইনারি ক্লাসিফায়ার ট্রেইন করতে ব্যবহৃত বাইনারি ক্রস-এনট্রপি লস সরাসরি বার্নোলি লাইকলিহুড থেকে ডেরাইভ করা — এটা আক্ষরিক অর্থেই মডেলের প্রেডিক্ট করা প্রোবাবিলিটি দিয়ে প্যারামিটারাইজড একটা বার্নোলি ডিস্ট্রিবিউশনের অধীনে সত্যিকারের লেবেলের নেগেটিভ লগ-প্রোবাবিলিটি।
বাইনোমিয়াল ডিস্ট্রিবিউশন একটা ফিক্সড সংখ্যক ইন্ডিপেন্ডেন্ট বার্নোলি ট্রায়ালে সাকসেসের সংখ্যা বর্ণনা করে, প্রতিটার একই সাকসেস প্রোবাবিলিটি । বার্নোলি যেখানে একটা কয়েন ফ্লিপ কভার করে, বাইনোমিয়াল কভার করে "টা ফ্লিপে কয়টা হেডস।"
একটা বাইনোমিয়াল র্যান্ডম ভেরিয়েবল আক্ষরিক অর্থেই টা ইন্ডিপেন্ডেন্ট বার্নোলি র্যান্ডম ভেরিয়েবলের যোগফল, প্রতিটার একই : । বসালে বাইনোমিয়াল ডিস্ট্রিবিউশন ঠিক বার্নোলিতে ফিরে আসে।
বাইনোমিয়াল ডিস্ট্রিবিউশন সঠিকভাবে প্রয়োগ করতে চারটা শর্ত একসাথে মানতে হয়:
ফিক্সড সংখ্যক ট্রায়াল
ট্রায়ালের সংখ্যা, n, আগে থেকে ঠিক করা, ফলাফলের উপর নির্ভর করে না।
ইন্ডিপেন্ডেন্ট ট্রায়াল
একটা ট্রায়ালের ফলাফল অন্য কোনো ট্রায়ালের সাকসেস প্রোবাবিলিটিতে প্রভাব ফেলে না।
দুইটা সম্ভাব্য ফলাফল
প্রতিটা আলাদা ট্রায়াল নিজেই একটা বার্নোলি ট্রায়াল — সাকসেস বা ফেইলিউর, আর কিছু না।
কনস্ট্যান্ট প্রোবাবিলিটি
প্রতিটা ট্রায়ালে সাকসেস প্রোবাবিলিটি p ঠিক একই।
যদি তুমি একটা ফাইনাইট পপুলেশন থেকে আইটেম ড্র করো কিন্তু ফেরত না দাও (Conditional Probability & Independence-এর সেকশন ৫), তাহলে পরপর ড্র নির্ভরশীল হয়ে যায় আর p টেকনিক্যালি প্রতিবার শিফট করে — আসল ডিস্ট্রিবিউশন হাইপারজিওমেট্রিক, বাইনোমিয়াল না। পপুলেশন যখন স্যাম্পলের চেয়ে অনেক বড় হয়, তখন বাইনোমিয়াল তখনও একটা ভালো অ্যাপ্রক্সিমেশন থাকে।
সব টা ট্রায়ালে মোট সাকসেসের সংখ্যা গণনা করে, তাই 0 থেকে পর্যন্ত যেকোনো ইন্টিজার মান নিতে পারে।
যেখানে:
দুইটা ফর্মুলাই টা ইন্ডিপেন্ডেন্ট বার্নোলি মিন/ভ্যারিয়েন্স যোগ করে সরাসরি বের হয় — , আর ইন্ডিপেন্ডেন্ট ভেরিয়েবলের জন্য ভ্যারিয়েন্সও একইভাবে যোগ হয়।
উদাহরণ। একটা fair কয়েন 5 বার ফ্লিপ করা হলো। ঠিক 3টা হেডসের প্রোবাবিলিটি কত? এখানে , , ।
টা ইন্ডিপেন্ডেন্ট এক্সাম্পলের একটা ব্যাচ বা টেস্ট সেটে, একটা বাইনারি ক্লাসিফায়ার মোট কতগুলো সঠিক (বা ভুল) পায়, সেটা প্রায় বাইনোমিয়াল ডিস্ট্রিবিউশন অনুসরণ করে — অ্যাকুরেসির চারপাশে কনফিডেন্স ইন্টারভাল তৈরি করতে কাজে লাগে।
A/B টেস্টিং এটার উপর সরাসরি নির্ভর করে: জনকে একটা ভ্যারিয়েন্ট দেখানোর পর কতজন কনভার্ট করে সেটা বাইনোমিয়াল, আর দুইটা বাইনোমিয়াল প্রোপোরশন তুলনা করাই A/B টেস্ট অ্যানালাইসিসের স্ট্যাটিস্টিক্যাল কোর।
যখন বলা হয় "আমাদের মডেল 100টা টেস্ট এক্সাম্পলের মধ্যে 94টা সঠিক পেয়েছে," বাইনোমিয়াল ডিস্ট্রিবিউশনই সেই টুল যা দিয়ে ওই 94%-এর সাথে একটা মার্জিন অফ এরর জোড়া যায় — ছোট টেস্ট সেট একটা চওড়া, কম ভরসাযোগ্য ইন্টারভাল দেয়; বড় সেট একটা সরু, বেশি ভরসাযোগ্য ইন্টারভাল দেয়।
মাল্টিনোমিয়াল ডিস্ট্রিবিউশন বাইনোমিয়ালকে দুই ফলাফল থেকে ফলাফলে জেনারালাইজ করে। এটা টা ইন্ডিপেন্ডেন্ট ট্রায়াল জুড়ে টা ক্যাটাগরির প্রতিটার গণনা বর্ণনা করে, যেখানে প্রতিটা ট্রায়াল ঠিক একটা ক্যাটাগরিতে পড়ে।
বাইনোমিয়াল হলো ঠিক 2টা ক্যাটাগরি () সহ মাল্টিনোমিয়ালের বিশেষ কেস। একটা ডাইস বার রোল করে প্রতিটা ফেস কতবার এসেছে গণনা করা সহ মাল্টিনোমিয়াল; একটা কয়েন বার ফ্লিপ করে হেডস গণনা করা মাল্টিনোমিয়াল (সমতুল্যভাবে বাইনোমিয়াল) সহ।
একটা মাত্র গণনা -এর বদলে, একটা মাল্টিনোমিয়াল ফলাফল হলো গণনার একটা ভেক্টর , প্রতি ক্যাটাগরিতে একটা, যা সবসময় -এ যোগ হয়: ।
একটা প্রোবাবিলিটি -এর বদলে, মাল্টিনোমিয়ালের টা প্রোবাবিলিটি আছে (প্রতি ক্যাটাগরিতে একটা), যা ১-এ যোগ হতে হবে: ।
যেখানে সামনের ভগ্নাংশটা গণনা করে ট্রায়ালগুলোর কতগুলো আলাদা অর্ডারিং এই নির্দিষ্ট ক্যাটাগরি গণনাগুলো তৈরি করতে পারে, আর প্রতিটা হলো নম্বর ক্যাটাগরির ট্রায়ালের শেয়ার যেভাবে হয়েছে তার প্রোবাবিলিটি।
উদাহরণ। একটা fair ছয়-পিঠের ডাইস 12 বার রোল করা হলো। প্রতিটা ফেস ঠিক দুইবার আসার প্রোবাবিলিটি কত? এখানে , , প্রতিটা , আর প্রতিটা ।
একটা softmax ক্লাসিফায়ারের টা ক্লাসের উপর আউটপুট ঠিক একটা মাল্টিনোমিয়াল প্রোবাবিলিটি ভেক্টর: এটা টা মিউচুয়ালি এক্সক্লুসিভ ক্লাস লেবেলের প্রতিটাতে একটা প্রোবাবিলিটি অ্যাসাইন করে, ১-এ যোগ হয় — বাইনারি ক্লাসিফিকেশনে ব্যবহৃত বার্নোলি আউটপুটের মাল্টি-ক্লাস সরাসরি অ্যানালগ।
একটা bag-of-words ডকুমেন্ট রিপ্রেজেন্টেশনে ওয়ার্ড গণনা, একটা সার্ভেতে ক্যাটাগরি গণনা, বা একটা লেবেলড ডেটাসেটে ক্লাস-গণনা ব্রেকডাউন — সবই স্বাভাবিকভাবে মাল্টিনোমিয়াল।
মাল্টিনোমিয়াল Naive Bayes ক্লাসিফায়ার — টেক্সট ক্লাসিফিকেশনের একটা স্ট্যান্ডার্ড চয়েস — সরাসরি প্রতিটা ক্লাসের ওয়ার্ড-কাউন্ট ভেক্টরকে vocabulary-এর উপর একটা মাল্টিনোমিয়াল ডিস্ট্রিবিউশন থেকে একটা ড্র হিসেবে মডেল করে, Conditional Probability & Independence-এর কন্ডিশনাল-ইন্ডিপেন্ডেন্স অ্যাসাম্প্শন ব্যবহার করে এটাকে ট্র্যাক্টেবল রাখে।
পয়সোঁ ডিস্ট্রিবিউশন একটা বিরল, ইন্ডিপেন্ডেন্ট ইভেন্ট একটা ফিক্সড টাইম বা স্পেসের ইন্টারভালে কতবার ঘটে সেটা বর্ণনা করে, যখন তুমি শুধু গড় রেট জানো কতবার এটা ঘটে — বাইনোমিয়ালের মতো কোনো ফিক্সড সংখ্যক "ট্রায়াল" জানা লাগে না।
বাইনোমিয়ালের মতো এখানে কোনো স্বাভাবিক "" নেই: তুমি ফিক্সড সংখ্যক অ্যাটেম্পটের মধ্যে সাকসেস গণনা করছো না, তুমি এমন একটা ইভেন্টের সংঘটন গণনা করছো যা নীতিগতভাবে ইন্টারভালের মধ্যে যেকোনো সংখ্যকবার ঘটতে পারে — প্রতি মিনিটে ওয়েবসাইট ভিজিট, প্রতি পাতায় টাইপো, প্রতি ঘণ্টায় গ্রাহক আগমন, প্রতি সেকেন্ডে রেডিওঅ্যাক্টিভ ডিকে।
এই ডিস্ট্রিবিউশনের ঠিক একটা প্যারামিটার আছে, (ল্যাম্বডা) — প্রতি ইন্টারভালে গড় ইভেন্ট সংখ্যা। এটা বাইনোমিয়াল ডিস্ট্রিবিউশনের -এর মতো একটা রোল প্লে করে, আর আসলে পয়সোঁ ডেরাইভ করা যায় বাইনোমিয়াল ডিস্ট্রিবিউশনের লিমিট হিসেবে যখন আর হয়, কিন্তু ফিক্সড থাকে (অনেক, অনেক ট্রায়াল, প্রতিটা আলাদাভাবে খুব অসম্ভাব্য)।
ইভেন্ট ইন্ডিপেন্ডেন্টলি ঘটে
একটা ইভেন্ট ঘটলে কাছাকাছি আরেকটা ইভেন্ট ঘটার প্রোবাবিলিটি বদলায় না।
কনস্ট্যান্ট গড় রেট
λ, গড় রেট, স্টাডি করা ইন্টারভাল জুড়ে বদলায় না।
ইভেন্ট একসাথে ঘটে না
একটা ইনফিনিটেসিমালি ছোট সাব-ইন্টারভালে, বড়জোর একটা ইভেন্ট ঘটে।
যেখানে:
একটা স্বতন্ত্র পয়সোঁ প্রোপার্টি: মিন আর ভ্যারিয়েন্স সবসময় ঠিক সমান, দুটোই -এর সমান। এটা একটা কাজের ডায়াগনস্টিক — বাস্তব গণনার ডেটায় ভ্যারিয়েন্স মিনের চেয়ে অনেক বড় হলে ("overdispersion") সেটা একটা সংকেত যে পয়সোঁ সঠিক মডেল নাও হতে পারে।
উদাহরণ। একটা কল সেন্টার গড়ে প্রতি মিনিটে 4টা কল পায় ()। একটা নির্দিষ্ট মিনিটে ঠিক 6টা কল পাওয়ার প্রোবাবিলিটি কত?
যেকোনো ML টাস্ক যার টার্গেট একটা গণনা — কেনাকাটার সংখ্যা, সাপোর্ট টিকেটের সংখ্যা, হাসপাতাল রিঅ্যাডমিশনের সংখ্যা — সাধারণ লিনিয়ার রিগ্রেশনের বদলে স্বাভাবিকভাবে পয়সোঁ রিগ্রেশন দিয়ে মডেল করা হয়, যা এই সত্যকে সম্মান করে যে গণনা নেগেটিভ হতে পারে না।
বিরল-ইভেন্ট গণনার জন্য অ্যানোমালি ডিটেকশন সিস্টেম (প্রতি ঘণ্টায় সার্ভার এরর, প্রতি দিনে ফ্রড অ্যাটেম্পট) প্রায়ই একটা পয়সোঁ বেসলাইন ব্যবহার করে: ঐতিহাসিক -এর অধীনে অত্যন্ত অসম্ভাব্য যেকোনো ইন্টারভালের আসল গণনা ফ্ল্যাগ করে।
কিউয়িং সিস্টেম, রেকমেন্ডেশন-সিস্টেম ক্লিক মডেলিং, আর নেটওয়ার্ক ট্র্যাফিক মডেলিং — সবই পয়সোঁ (আর এর কন্টিনিউয়াস-টাইম সঙ্গী, এক্সপোনেনশিয়াল ডিস্ট্রিবিউশন — দেখো সেকশন ১৩) এর উপর নির্ভর করে বর্ণনা করতে ইভেন্টগুলো কত ঘন ঘন "আসে।"
জিওমেট্রিক ডিস্ট্রিবিউশন প্রথম সাকসেস পেতে কতগুলো বার্নোলি ট্রায়াল দরকার সেটা বর্ণনা করে — "প্রথম হেডস পেতে কতগুলো কয়েন ফ্লিপ লাগবে?"
গণনা করে কোন ট্রায়াল নম্বরে প্রথম সাকসেস আসে, তাই — নীতিগতভাবে এটা যেকোনো বড় মান নিতে পারে, কারণ ফেইলিউরের একটা লম্বা দুর্ভাগ্যজনক স্ট্রিক সবসময় টেকনিক্যালি সম্ভব।
যেখানে হলো প্রথম টা ট্রায়াল সবগুলো ফেইল হওয়ার প্রোবাবিলিটি, আর শেষ ফ্যাক্টর হলো নম্বর ট্রায়াল সাকসেস হওয়ার প্রোবাবিলিটি।
স্বজ্ঞাতভাবেই যুক্তিসঙ্গত: সাকসেস যদি বিরল হয় (ছোট ), তুমি প্রথমটার জন্য অনেকক্ষণ অপেক্ষা করবে বলে আশা করবে (বড় )।
জিওমেট্রিক ডিস্ট্রিবিউশনের একটা চমকপ্রদ প্রোপার্টি আছে: । সহজ কথায় — তুমি যদি আগেই পরপর বার ফেইল করে থাকো, তাহলে আরও কমপক্ষে টা ট্রায়াল লাগার প্রোবাবিলিটি ঠিক একই, যেন তুমি নতুন করে শুরু করছো। আগের ফেইলিউরগুলো তোমাকে জিরো তথ্য দেয় তুমি আরও কতক্ষণ অপেক্ষা করবে তা নিয়ে — প্রসেসটার কোনো "মেমোরি" নেই এটা এতক্ষণ চলেছে সেটার।
নেগেটিভ বাইনোমিয়াল ডিস্ট্রিবিউশন জিওমেট্রিককে জেনারালাইজ করে: প্রথম সাকসেসে থামার বদলে, এটা যেকোনো ফিক্সড -এর জন্য নম্বর সাকসেস পেতে কতগুলো ট্রায়াল দরকার সেটা বর্ণনা করে।
জিওমেট্রিক হলো সহ নেগেটিভ বাইনোমিয়ালের বিশেষ কেস — "১ম সাকসেস পর্যন্ত ট্রায়াল" ঠিক সেকশন ৭-এ যা কভার করা হয়েছে।
গণনা করে কোন ট্রায়ালে নম্বর সাকসেস আসে, তাই — এটা কখনো -এর চেয়ে ছোট হতে পারে না, কারণ টা সাকসেস পেতে অন্তত টা ট্রায়াল দরকার।
যেখানে গণনা করে প্রথম টা ট্রায়াল ঠিক টা সাকসেস কীভাবে ধারণ করতে পারে (গণনা করা হচ্ছে এমন নম্বর ট্রায়ালটাই নম্বর, আর শেষ, সাকসেস হতে হবে)।
দুটোই সংশ্লিষ্ট জিওমেট্রিক ফর্মুলার ঠিক গুণ — নম্বর সাকসেসে পৌঁছাতে, গড়ে, প্রথমটায় পৌঁছানোর গুণ সময় লাগে।
উদাহরণ। একজন বাস্কেটবল খেলোয়াড় প্রোবাবিলিটি দিয়ে ফ্রি থ্রো করে। 5টা ফ্রি থ্রো করতে গড়ে কতগুলো অ্যাটেম্পট দরকার? টা অ্যাটেম্পট।
একটা কন্টিনিউয়াস ডিস্ট্রিবিউশন এমন একটা র্যান্ডম ভেরিয়েবল নিয়ন্ত্রণ করে যা একটা রেঞ্জের মধ্যে যেকোনো মান নিতে পারে — উচ্চতা, ওজন, সময়, তাপমাত্রা — সম্ভাব্য মানের মধ্যে কোনো গ্যাপ ছাড়া। ডিসক্রিট ভেরিয়েবলের থেকে ভিন্ন, তুমি সম্ভাব্য প্রতিটা ফলাফল লিস্ট করতে পারো না, নীতিগতভাবেও না: যেকোনো দুইটা মানের মধ্যে, অসংখ্য অন্য মান বিদ্যমান।
PMF-এর কন্টিনিউয়াস অ্যানালগ হলো প্রোবাবিলিটি ডেনসিটি ফাংশন, । গুরুত্বপূর্ণ পার্থক্য: নিজে একটা প্রোবাবিলিটি না, এমনকি এটা ১-এর চেয়ে বেশিও হতে পারে। এটা প্রোবাবিলিটিতে পরিণত হয় শুধুমাত্র যখন তুমি এটাকে একটা ইন্টারভালের উপর ইন্টিগ্রেট করো।
একটা কন্টিনিউয়াস র্যান্ডম ভেরিয়েবলের জন্য, কোনো একটা ঠিক মানে পড়ার প্রোবাবিলিটি সবসময় শূন্য — অসংখ্য সম্ভাব্য মান আছে, তাই একটা একক মান মোট প্রোবাবিলিটির একটা ইনফিনিটেসিমালি পাতলা অংশ পায়। এটা এড়িয়ে যাওয়ার মতো টেকনিক্যালিটি না: এই কারণেই কন্টিনিউয়াস প্রোবাবিলিটির প্রশ্ন সবসময় রেঞ্জ হিসেবে করা হয় ("5 আর 6-এর মাঝে"), কখনো একক পয়েন্ট হিসেবে না ("ঠিক 5.000...")।
একটা কন্টিনিউয়াস ভেরিয়েবলের প্রোবাবিলিটি পড়া হয় PDF কার্ভের নিচের এরিয়া হিসেবে, কার্ভের উচ্চতা হিসেবে না। কোনো পয়েন্টে PDF উঁচু হওয়া মানে ওই নির্দিষ্ট মানটা সম্ভাব্য না — এর মানে ওই পয়েন্টের কাছাকাছি মানগুলো, একসাথে, অনেকটা প্রোবাবিলিটি বহন করে।
যেখানে প্রথম ইন্টিগ্রালটা হলো আর -এর মাঝে কার্ভের নিচে শেড করা এরিয়া, আর দ্বিতীয়টা বলে সম্ভাব্য প্রতিটা মান জুড়ে পুরো কার্ভের নিচের মোট এরিয়া ঠিক ১ হতে হবে — "প্রোবাবিলিটি ১-এ যোগ হয়" এর কন্টিনিউয়াস ভার্সন।
নিচের ইন্টারভাল এন্ডপয়েন্টগুলো টেনে দেখো, শেড করা এরিয়াটা — আসল প্রোবাবিলিটি — একটা একক পয়েন্টের দিকে ইন্টারভাল সংকুচিত হওয়ার সাথে সাথে কীভাবে শূন্যের দিকে সংকুচিত হয়, যদিও কার্ভের উচ্চতা পুরোটা সময় পজিটিভ থাকে। "উচ্চতা" আর "প্রোবাবিলিটি"-এর মধ্যে এই ফারাকটাই এই সেকশনের সবচেয়ে গুরুত্বপূর্ণ আইডিয়া।
ইন্টারভাল এন্ডপয়েন্ট টেনে দেখো কীভাবে PDF-এর নিচের এরিয়া (উচ্চতা না) প্রোবাবিলিটি দেয়।
P(3.00 ≤ X ≤ 6.00)
0.3000
F(3.00)
0.3000
F(6.00)
0.6000
P(X = single point)
0.0000
Drag c and d toward each other — the shaded area (the probability) shrinks toward 0 as the interval width shrinks toward 0, even though the curve's height f(x) stays positive. That's exactly why P(X = x) = 0 for a continuous random variable: a single point has zero width, so it contributes zero area.
| প্রোপার্টি | ডিসক্রিট | কন্টিনিউয়াস |
|---|---|---|
| বর্ণনাকারী ফাংশন | PMF, p(x) = P(X=x) | PDF, f(x) — নিজে একটা প্রোবাবিলিটি না |
| P(X = ঠিক একটা মান) | নন-জিরো হতে পারে | সবসময় ঠিক 0 |
| প্রোবাবিলিটি কীভাবে বের করবে | মানের একটা সেট জুড়ে PMF যোগ করো | একটা রেঞ্জের উপর PDF ইন্টিগ্রেট করো (এরিয়া) |
| মোট প্রোবাবিলিটির নিয়ম | Σ p(x) = 1 | সব x-এর উপর ∫ f(x) dx = 1 |
| সাধারণ উদাহরণ | কয়েন ফ্লিপ, ডিফেক্ট গণনা, ওয়েবসাইট ভিজিট | উচ্চতা, সময়, তাপমাত্রা, মাপার এরর |
ইউনিফর্ম ডিস্ট্রিবিউশন এমন একটা র্যান্ডম ভেরিয়েবল বর্ণনা করে যেখানে প্রতিটা ফলাফল (বা একটা রেঞ্জের প্রতিটা পয়েন্ট) সমানভাবে সম্ভাব্য — কোনো মানকে অন্যটার চেয়ে বেশি প্রাধান্য দেওয়া হয় না।
টা সমানভাবে সম্ভাব্য ডিসক্রিট ফলাফলের জন্য (যেমন একটা fair ডাইস), প্রতিটার প্রোবাবিলিটি । প্রতিটা "ফেয়ার" র্যান্ডম ডিভাইসের পেছনে এই ডিস্ট্রিবিউশনটাই — ডাইস, কয়েন, শাফল করা ডেক — যখনই প্রতিটা ফলাফলকে সমানভাবে সম্ভাব্য ধরা হয়।
একটা ইন্টারভাল -এ সীমাবদ্ধ একটা কন্টিনিউয়াস ভেরিয়েবলের জন্য, ইউনিফর্ম ডিস্ট্রিবিউশন পুরো ইন্টারভাল জুড়ে কনস্ট্যান্ট ডেনসিটি অ্যাসাইন করে, আর এর বাইরে জিরো ডেনসিটি।
কন্টিনিউয়াস ইউনিফর্ম ডিস্ট্রিবিউশন মাত্র দুইটা সংখ্যা দিয়ে পুরোপুরি বর্ণনা করা যায়: (লোয়ার বাউন্ড) আর (আপার বাউন্ড)।
যেখানে কনস্ট্যান্ট উচ্চতা এমনভাবে বাছাই করা যাতে কার্ভের নিচের মোট আয়তাকার এরিয়া — প্রস্থ গুণ উচ্চতা — ঠিক ১ হয়, যা প্রতিটা ভ্যালিড PDF-এর দরকার।
ইন্টারভালের মিডপয়েন্ট — প্রতিটা মান সমান ওয়েট পেলে স্বাভাবিক "ব্যালান্স পয়েন্ট।"
নর্মাল ডিস্ট্রিবিউশন হলো স্ট্যাটিস্টিক্স আর মেশিন লার্নিং-এর সবচেয়ে গুরুত্বপূর্ণ কন্টিনিউয়াস ডিস্ট্রিবিউশন — সেই পরিচিত সিমেট্রিক "বেল কার্ভ" যা প্রাকৃতিক আর মানুষ-তৈরি প্রসেসের মাপ অনুসরণ করতে থাকে, বিশেষ করে যখন একটা মাপ অনেক ছোট, ইন্ডিপেন্ডেন্ট প্রভাবের যোগফল।
"নর্মাল ডিস্ট্রিবিউশন" আর "গসিয়ান ডিস্ট্রিবিউশন" একই জিনিসের দুইটা নাম, কার্ল ফ্রিডরিখ গাউসের নামে নামকরণ। দুইটা টার্মই ML লিটারেচারে বারবার আসে — একটা "গসিয়ান নয়েজ মডেল" আর একটা "নর্মাল এরর অ্যাসাম্প্শন" একই জিনিস বোঝায়।
নর্মাল ডিস্ট্রিবিউশন একটা মসৃণ, সিমেট্রিক, বেল-শেপড কার্ভ: এটা তার মিনে পিক করে, দুই পাশেই মসৃণভাবে আর সিমেট্রিকভাবে নেমে আসে, আর কখনো আসলে শূন্য স্পর্শ করে না, যতই দূরে যাও না কেন — এটা শুধু ক্রমশ শূন্যের খুব কাছাকাছি হতে থাকে।
(মিউ) পিকের অবস্থান ঠিক করে — বেল কার্ভটা কোথায় কেন্দ্রীভূত। বদলালে পুরো কার্ভটা বাম বা ডানে সরে যায়, শেপ বদলায় না।
(সিগমা) বেল কার্ভের স্প্রেড ঠিক করে। ছোট একটা লম্বা, সরু বেল তৈরি করে (ফলাফল -এর চারপাশে ঘনভাবে জড়ো হয়); বড় একটা খাটো, চওড়া বেল তৈরি করে (ফলাফল আরও ছড়িয়ে পড়ে)।
যেখানে:
-এর চারপাশে কার্ভটা একদম আয়নার মতো প্রতিবিম্ব — যেকোনো দূরত্ব -এর জন্য ।
স্বতন্ত্র শেপ: মসৃণভাবে একটা মাত্র পিকে উঠে, তারপর মসৃণভাবে নিচে নামা, অন্য কোনো উঁচু-নিচু ছাড়া — নর্মাল ডিস্ট্রিবিউশন সবসময় ইউনিমোডাল।
সম্পূর্ণ সিমেট্রির কারণে, তিনটা স্ট্যান্ডার্ড "সেন্টার" মেজারই ঠিক -তে মিলে যায় — Log-Normal-এর (সেকশন ১৬) মতো স্কিউড ডিস্ট্রিবিউশনে এই প্রোপার্টি থাকে না।
বদলালে পুরো কার্ভটা হরাইজন্টালি ট্রান্সলেট করে, এর শেপ আর স্প্রেড সম্পূর্ণ অপরিবর্তিত থাকে।
বদলালে কার্ভ হরাইজন্টালি টানা বা সংকুচিত হয় (আর সেই অনুযায়ী উচ্চতাও সামঞ্জস্য হয়, যাতে এরিয়া তখনও ১-এ ইন্টিগ্রেট হয়) — বড় মানে একটা চ্যাপ্টা, চওড়া কার্ভ; ছোট মানে একটা লম্বা, সরু কার্ভ।
যেকোনো নর্মাল ডিস্ট্রিবিউশনের জন্য, তার আর যাই হোক না কেন, মোট প্রোবাবিলিটির একটা ফিক্সড অংশ সবসময় মিনের নির্দিষ্ট সংখ্যক স্ট্যান্ডার্ড ডেভিয়েশনের মধ্যে পড়ে:
68%
মানের μ ± 1σ-এর মধ্যে পড়ে (মিনের এক স্ট্যান্ডার্ড ডেভিয়েশনের মধ্যে)।
95%
মানের μ ± 2σ-এর মধ্যে পড়ে (মিনের দুই স্ট্যান্ডার্ড ডেভিয়েশনের মধ্যে)।
99.7%
মানের μ ± 3σ-এর মধ্যে পড়ে (মিনের তিন স্ট্যান্ডার্ড ডেভিয়েশনের মধ্যে) — এর বাইরে সত্যিই বিরল।
এই "68-95-99.7 রুল"-এর কারণেই মিন থেকে "3σ-এর বেশি দূরে" থাকা একটা রেজাল্টকে এত স্ট্যাটিস্টিক্যাল আর ML কনটেক্সটে আউটলায়ার বা অ্যানোমালির একটা শক্তিশালী সিগন্যাল হিসেবে ট্রিট করা হয়।
অনেক রিয়েল-ভ্যালুড ফিচার — মাপ, সেন্সর রিডিং, অ্যাগ্রিগেটেড স্কোর — প্রায় নর্মাল, আর এই কারণেই এত preprocessing আর মডেলিং টেকনিক এটাকে বেসলাইন হিসেবে অ্যাসাম্প্শন নেয়।
সাধারণ least-squares লিনিয়ার রিগ্রেশনের পেছনের স্ট্যান্ডার্ড অ্যাসাম্প্শন হলো রেসিডুয়াল এরর — একটা প্রেডিকশন আর আসল মানের মধ্যে ফারাক — নর্মালি ডিস্ট্রিবিউটেড, মিন 0 সহ। এই একটা মাত্র অ্যাসাম্প্শনই স্কয়ার্ড-এরর লসকে স্ট্যাটিস্টিক্যালি "সঠিক" চয়েস বানায় (এটা গসিয়ান নয়েজের অধীনে ম্যাক্সিমাম-লাইকলিহুড লস)।
প্রায় পুরো ক্লাসিক্যাল স্ট্যাটিস্টিক্স জুড়ে কনফিডেন্স ইন্টারভাল, হাইপোথিসিস টেস্ট, আর p-ভ্যালু নর্মাল ডিস্ট্রিবিউশনের উপর নির্ভর করে, প্রায়ই সেন্ট্রাল লিমিট থিওরেম দিয়ে জাস্টিফাই করা — যে সত্যটা অনেক ইন্ডিপেন্ডেন্ট র্যান্ডম কোয়ান্টিটির গড় নর্মালের দিকে ঝুঁকতে থাকে, মূল ভেরিয়েবলগুলোর নিজেদের ডিস্ট্রিবিউশন যাই হোক না কেন।
গসিয়ান Naive Bayes প্রতিটা নিউমেরিক ফিচারকে, প্রতিটা ক্লাসের মধ্যে, নর্মালি ডিস্ট্রিবিউটেড হিসেবে মডেল করে। গসিয়ান প্রসেস (ইনফাইনাইট-ডাইমেনশনাল) নর্মাল ডিস্ট্রিবিউশন ব্যবহার করে পুরো ফাংশন মডেল করে। গসিয়ান মিক্সচার মডেল (সেকশন ১৭-তে আবার প্রিভিউ করা হবে) জটিল, মাল্টি-ক্লাস্টার ডেটাকে বেশ কয়েকটা নর্মাল "বাম্প"-এর ওয়েটেড যোগফল হিসেবে রিপ্রেজেন্ট করে।
স্ট্যান্ডার্ড নর্মাল ডিস্ট্রিবিউশন হলো আর সহ একটা নির্দিষ্ট নর্মাল ডিস্ট্রিবিউশন। এটা সেই ইউনিভার্সাল রেফারেন্স কার্ভ যেটাতে অন্য যেকোনো নর্মাল ডিস্ট্রিবিউশন কনভার্ট করা যায়।
একটা z-স্কোর মাপে একটা মান তার ডিস্ট্রিবিউশনের মিনের কতটা স্ট্যান্ডার্ড ডেভিয়েশন উপরে (পজিটিভ) বা নিচে (নেগেটিভ) বসে আছে:
যেখানে একটা একক ইউনিটলেস সংখ্যায় বলে দেয় তার নিজের ডিস্ট্রিবিউশনের তুলনায় ঠিক কতটা অস্বাভাবিক — মানে ঠিক গড়, মানে গড়ের দুই স্ট্যান্ডার্ড ডেভিয়েশন উপরে, ইত্যাদি।
স্ট্যান্ডার্ডাইজেশন হলো যেকোনো নর্মাল র্যান্ডম ভেরিয়েবলকে একটা স্ট্যান্ডার্ড নর্মালে রূপান্তরের প্রসেস, প্রতিটা মানের z-স্কোর হিসাব করে। যেহেতু আর অ্যালজেব্রেইকভাবে ক্যান্সেল হয়ে যায়, একটা স্ট্যান্ডার্ডাইজড ভেরিয়েবলের সবসময় মিন 0 আর স্ট্যান্ডার্ড ডেভিয়েশন 1 থাকে, মূল আর যাই হোক না কেন।
একটা z-টেবিল -এর প্রিকম্পিউটেড মান লিস্ট করে — স্ট্যান্ডার্ড নর্মাল CDF — -এর একটা বিস্তৃত রেঞ্জের জন্য, যা দিয়ে তুমি ভ্যালু স্ট্যান্ডার্ডাইজড হয়ে যাওয়ার পর ক্যালকুলাস ছাড়াই হাতে যেকোনো নর্মাল প্রোবাবিলিটি লুকআপ করতে পারো।
উদাহরণ। অ্যাডাল্ট উচ্চতা নর্মালি ডিস্ট্রিবিউটেড সেমি, সেমি সহ। কত? প্রথমে স্ট্যান্ডার্ডাইজ করো:
তারপর z-টেবিলে লুকআপ করো: প্রায় — এই মডেলের অধীনে প্রায় 93.3% অ্যাডাল্ট 185সেমি বা তার কম লম্বা।
| Z-স্কোর | ইন্টারপ্রিটেশন |
|---|---|
| z = 0 | ঠিক মিনে — সম্পূর্ণ গড় |
| z = 1 | মিনের এক স্ট্যান্ডার্ড ডেভিয়েশন উপরে — মোটামুটি গড়ের চেয়ে বেশি |
| z = -2 | মিনের দুই স্ট্যান্ডার্ড ডেভিয়েশন নিচে — উল্লেখযোগ্যভাবে গড়ের চেয়ে কম |
| |z| > 3 | এম্পিরিক্যাল রুলের অধীনে অত্যন্ত অস্বাভাবিক — প্রায়ই আউটলায়ার হিসেবে ফ্ল্যাগ করা হয় |
StandardScaler — ML-এ সবচেয়ে বেশি ব্যবহৃত preprocessing স্টেপগুলোর একটা — গাণিতিকভাবে ঠিক স্ট্যান্ডার্ডাইজেশন যা করে তাই করে: প্রতিটা ফিচারের মিন বাদ দাও আর স্ট্যান্ডার্ড ডেভিয়েশন দিয়ে ভাগ করো, প্রতিটা ফিচারকে তুলনাযোগ্য স্কেল দিয়ে (মিন 0, স্ট্যান্ডার্ড ডেভিয়েশন 1) যাতে শুধু কাঁচা ইউনিটের কারণে কোনো ফিচার একটা মডেলে প্রাধান্য না পায়।
যেকোনো ডেটা পয়েন্ট (বা অন্য কোনো নির্বাচিত থ্রেশহোল্ড) দিয়ে ফ্ল্যাগ করা সবচেয়ে সিম্পল আর বহুল ব্যবহৃত আউটলায়ার-ডিটেকশন টেকনিকগুলোর একটা — সরাসরি স্ট্যান্ডার্ড নর্মাল ডিস্ট্রিবিউশন আর সেকশন ১১-এর এম্পিরিক্যাল রুলের উপর তৈরি।
এক্সপোনেনশিয়াল ডিস্ট্রিবিউশন পয়সোঁ-স্টাইল ইভেন্টের পরের সংঘটন পর্যন্ত অপেক্ষার সময় বর্ণনা করে — সেকশন ৭-এর ডিসক্রিট জিওমেট্রিক ডিস্ট্রিবিউশনের কন্টিনিউয়াস-টাইম কাউন্টারপার্ট।
পয়সোঁর মতো, এক্সপোনেনশিয়ালও একটা মাত্র রেট প্যারামিটার, , দিয়ে নিয়ন্ত্রিত — প্রতি ইউনিট সময়ে গড় ইভেন্ট সংখ্যা। বড় মানে ইভেন্ট আরও ঘন ঘন ঘটে, তাই অপেক্ষার সময় তাদের মাঝে তখন কম হতে থাকে।
যেখানে ডেনসিটি -তে সবচেয়ে বেশি আর বড় হওয়ার সাথে সাথে মসৃণভাবে ও ধারাবাহিকভাবে কমে — যেকোনো ফিক্সড রেট -এর জন্য ছোট অপেক্ষা সবসময় লম্বা অপেক্ষার চেয়ে বেশি সম্ভাব্য।
তার ডিসক্রিট চাচাতো ভাই জিওমেট্রিক ডিস্ট্রিবিউশনের মতো, এক্সপোনেনশিয়াল ডিস্ট্রিবিউশনও মেমোরিলেস: । এক্সপোনেনশিয়াল লাইফটাইম দিয়ে মডেল করা একটা বাল্ব যদি ইতিমধ্যে ঘণ্টা টিকে থাকে, তাহলে আরও ঘণ্টা টিকে থাকার প্রোবাবিলিটি ঠিক তেমনই যেমন একটা একদম নতুন বাল্বের ঘণ্টা টিকে থাকার — এর অতীতের টিকে থাকা এর বাকি লাইফটাইম সম্পর্কে কোনো তথ্য দেয় না। (এটা এমন পার্টের জন্য খারাপ মডেল যেগুলো সত্যিই বয়সের সাথে ক্ষয় হয়, এই কারণেই Weibull ডিস্ট্রিবিউশন, যা এখানে কভার করা হয়নি এমন একটা জেনারালাইজেশন, ওই কেসগুলোর জন্য বিদ্যমান।)
পয়সোঁ আর এক্সপোনেনশিয়াল দুই ভিন্ন কোণ থেকে একই আন্ডারলাইং র্যান্ডম প্রসেস বর্ণনা করে: পয়সোঁ গণনা করে একটা ফিক্সড টাইম উইন্ডোতে কতগুলো ইভেন্ট ঘটে; এক্সপোনেনশিয়াল মাপে ধারাবাহিক ইভেন্টের মাঝে কতক্ষণ অপেক্ষা করতে হয়। ইভেন্ট যদি পয়সোঁ রেট -তে ঘটে, তাদের মাঝের ফাঁকগুলো সেই একই সহ এক্সপোনেনশিয়ালি ডিস্ট্রিবিউটেড।
দোকানে গ্রাহক আগমনের মাঝে সময়, ওয়েবসাইট ভিজিটের মাঝে সময়, একটা কল সেন্টারে ফোন কলের মাঝে সময় — যেখানেই পয়সোঁ ইভেন্ট গণনা করে, এক্সপোনেনশিয়াল তাদের মাঝের ফাঁক বর্ণনা করে।
একটা স্টেবল রিজিয়নে পরবর্তী ভূমিকম্প পর্যন্ত সময়, কনস্ট্যান্ট স্ট্রেসের অধীনে পরবর্তী সিস্টেম ফেইলিউর পর্যন্ত সময়, একটা পয়সোঁ-আগমন কিউতে সার্ভ হওয়ার আগে একজন গ্রাহকের অপেক্ষার সময়।
রিলায়াবিলিটি ইঞ্জিনিয়ারিং কনস্ট্যান্ট ফেইলিউর রেট (কোনো wear-out ইফেক্ট ছাড়া) সহ কম্পোনেন্টের লাইফটাইম মডেল করতে এক্সপোনেনশিয়াল ডিস্ট্রিবিউশন ব্যবহার করে — সরাসরি ওয়ারেন্টি পিরিয়ড আর মেইনটেন্যান্স শিডিউলে তথ্য দেয়।
গামা ডিস্ট্রিবিউশন এক্সপোনেনশিয়ালকে ঠিক সেভাবে জেনারালাইজ করে যেভাবে নেগেটিভ বাইনোমিয়াল জিওমেট্রিককে জেনারালাইজ করে: প্রথম ইভেন্টের জন্য অপেক্ষার সময়ের বদলে, এটা নম্বর ইভেন্ট ঘটার জন্য অপেক্ষার সময়।
শেপ প্যারামিটার, সাধারণত (বা ) লেখা হয়, কতগুলো ইভেন্টের জন্য অপেক্ষা করা হচ্ছে সেটা কন্ট্রোল করে, আর সেই অনুযায়ী ডিস্ট্রিবিউশনটা কতটা পিকড বা ছড়ানো তা ঠিক করে। গামাকে ঠিক এক্সপোনেনশিয়ালে সংকুচিত করে দেয়।
রেট প্যারামিটার (বা সমতুল্যভাবে এর রেসিপ্রোকাল, স্কেল প্যারামিটার ) কন্ট্রোল করে ইভেন্ট কত দ্রুত ঘটে, ঠিক এক্সপোনেনশিয়াল আর পয়সোঁর মতো।
যেখানে হলো গামা ফাংশন — ফ্যাক্টোরিয়ালের একটা জেনারালাইজেশন ( একটা পজিটিভ ইন্টিজার হলে ) — শুধু একটা নরমালাইজিং কনস্ট্যান্ট হিসেবে অন্তর্ভুক্ত যাতে মোট এরিয়া ঠিক ১-এ ইন্টিগ্রেট হয়।
ইন্টিজার শেপ সহ একটা গামা র্যান্ডম ভেরিয়েবল আক্ষরিক অর্থেই টা ইন্ডিপেন্ডেন্ট এক্সপোনেনশিয়াল র্যান্ডম ভেরিয়েবলের যোগফল, প্রতিটার একই রেট — ঠিক যেভাবে নেগেটিভ বাইনোমিয়াল জিওমেট্রিক-স্টাইল অপেক্ষার যোগফল সেভাবেই। বসালে ঠিক এক্সপোনেনশিয়াল ডিস্ট্রিবিউশন ফিরে পাওয়া যায়, আর গামা বেয়েসিয়ান স্ট্যাটিস্টিক্স জুড়ে রেট প্যারামিটারের জন্য স্ট্যান্ডার্ড প্রায়র ডিস্ট্রিবিউশন হিসেবে দেখা যায় (বিশেষভাবে, পয়সোঁ ডিস্ট্রিবিউশনের নিজের -এর জন্য একটা স্বাভাবিক প্রায়র হিসেবেও)।
বিটা ডিস্ট্রিবিউশন একটা কন্টিনিউয়াস ডিস্ট্রিবিউশন যা শুধুমাত্র ইন্টারভালে সংজ্ঞায়িত — এটাকে সেই স্বাভাবিক ডিস্ট্রিবিউশন বানিয়ে দেয় যখন তুমি সরাসরি ডেটা মডেল করার বদলে একটা প্রোবাবিলিটিকেই একটা অনিশ্চিত কোয়ান্টিটি হিসেবে মডেল করছো।
নর্মাল যেখানে একটা রিয়েল-ভ্যালুড মাপ মডেল করে আর গামা যেখানে একটা পজিটিভ অপেক্ষার সময় মডেল করে, বিটা মডেল করে "একটা অজানা প্রোবাবিলিটি -এর মান কী?" — একটা নির্দিষ্ট অর্থে, একটা প্রোবাবিলিটির প্রোবাবিলিটি।
বিটার দুইটা শেপ প্যারামিটার আছে, আর , দুটোই পজিটিভ। মোটামুটিভাবে, ডিস্ট্রিবিউশনের মাসকে 1-এর দিকে টানে, আর 0-এর দিকে টানে; এদের আপেক্ষিক আকার একসাথে ঠিক করে দেয় ডিস্ট্রিবিউশনটা কতটা পিকড, ফ্ল্যাট, বা স্কিউড।
যেখানে হলো বিটা ফাংশন, আবারও শুধু একটা নরমালাইজিং কনস্ট্যান্ট হিসেবে আছে যাতে ডেনসিটি -এর উপর ঠিক ১-এ ইন্টিগ্রেট হয়।
| প্যারামিটার | ফলাফলি শেপ |
|---|---|
| α = β = 1 | ফ্ল্যাট — [0,1]-এ কন্টিনিউয়াস ইউনিফর্ম ডিস্ট্রিবিউশনের সাথে হুবহু |
| α = β > 1 | সিমেট্রিক হাম্প, 0.5-এ কেন্দ্রীভূত |
| α > β | 1-এর দিকে স্কিউড (বেশি প্রোবাবিলিটির দিকে মাস কেন্দ্রীভূত) |
| α < β | 0-এর দিকে স্কিউড (কম প্রোবাবিলিটির দিকে মাস কেন্দ্রীভূত) |
| α, β < 1 | U-শেপড — মাস 0 আর 1 দুইটার কাছেই জমা হয় |
A/B টেস্টিং-এর কনভার্সন-রেট অনিশ্চয়তা একটা টেক্সটবুক বিটা ইউজ কেস: কিছু সাকসেস আর ফেইলিউর দেখার পর, একটা বিটা ডিস্ট্রিবিউশন সত্যিকারের কনভার্সন রেটের জন্য সম্ভাব্য মানের পুরো রেঞ্জ ধরে রাখে, শুধু একটা পয়েন্ট এস্টিমেট না।
বেয়েসিয়ান স্ট্যাটিস্টিক্সে একটা বার্নোলি/বাইনোমিয়াল লাইকলিহুডের জন্য বিটা স্ট্যান্ডার্ড কনজুগেট প্রায়র — মানে তোমার নিয়ে প্রায়র বিলিফ যদি বিটা-ডিস্ট্রিবিউটেড হয়, আর তুমি বাইনোমিয়াল ডেটা দেখো, তাহলে নিয়ে তোমার আপডেটেড (পোস্টেরিয়র) বিলিফও ঠিক বিটা-ডিস্ট্রিবিউটেড, প্যারামিটারগুলো শুধু পর্যবেক্ষিত সাকসেস আর ফেইলিউর দিয়ে শিফট করা। এই ক্লোজড-ফর্ম আপডেটিং-এর কারণেই বিটা সবসময় go-to প্রায়র হিসেবে দেখা যায় যেখানেই একটা প্রোবাবিলিটি ডেটা থেকে এস্টিমেট করা হচ্ছে — এটা বেয়েসিয়ান আপডেটিংকে একটা কঠিন ইন্টিগ্রাল থেকে সিম্পল যোগে বদলে দেয়।
একটা র্যান্ডম ভেরিয়েবল লগ-নর্মালি ডিস্ট্রিবিউটেড যদি (এর ন্যাচারাল লগারিদম) নর্মালি ডিস্ট্রিবিউটেড হয়। সমতুল্যভাবে: একটা নর্মাল ভেরিয়েবল নাও আর এক্সপোনেনশিয়েট করো, ফলাফল লগ-নর্মাল।
প্রতিটা লগ-নর্মাল ডিস্ট্রিবিউশন সরাসরি একটা আন্ডারলাইং নর্মাল ডিস্ট্রিবিউশন থেকে তৈরি — এর প্যারামিটার আর আক্ষরিক অর্থেই -এর মিন আর স্ট্যান্ডার্ড ডেভিয়েশন, নিজের না। এটা একটা সাধারণ বিভ্রান্তির উৎস, স্পষ্টভাবে বলে রাখা দরকার।
যেখানে -এর নর্মাল ডিস্ট্রিবিউশন বর্ণনা করে, আর অতিরিক্ত ফ্যাক্টরটা (সাধারণ নর্মাল PDF-এর তুলনায়) লগারিদম নেওয়ার সাথে জড়িত চেঞ্জ-অফ-ভেরিয়েবল গণিত থেকে আসে।
খেয়াল করো -এর মিন শুধু না — অতিরিক্ত টার্মটা এই সত্যটা প্রতিফলিত করে যে একটা সিমেট্রিক নর্মাল ডিস্ট্রিবিউশন এক্সপোনেনশিয়েট করলে একটা অ্যাসিমেট্রিক, রাইট-স্কিউড ফলাফল আসে, যা মিনকে মিডিয়ানের উপরে টেনে নেয়।
উদাহরণ পর্যবেক্ষণ। লগ-নর্মালের মিডিয়ান ঠিক , কিন্তু এর মিন সবসময় কিছুটা বড় — রাইট স্কিউর একটা সরাসরি নিউমেরিক ফিঙ্গারপ্রিন্ট: অল্প কয়েকটা খুব বড় মান মিনকে উপরে টেনে নেয়, কিন্তু "টিপিক্যাল" (মিডিয়ান) মানকে ততটা নাড়ায় না।
ব্যক্তিগত আয় লগ-নর্মালের একটা ক্লাসিক উদাহরণ: বেশিরভাগ মানুষ একটা "টিপিক্যাল" পরিমাণ আয় করে, কিন্তু তুলনামূলকভাবে অল্পসংখ্যক খুব বেশি আয় করা মানুষ একটা লম্বা রাইট টেইল তৈরি করে যা একটা সিমেট্রিক নর্মাল ডিস্ট্রিবিউশন খারাপভাবে মিসরিপ্রেজেন্ট করবে।
অ্যাসেট প্রাইস আর অন্য মাল্টিপ্লিকেটিভলি-কম্পাউন্ডিং কোয়ান্টিটি (একটা স্টক প্রতিদিন একটা শতকরা হারে উঠা-নামা) লগ-নর্মালের দিকে ঝোঁকে, কারণ অনেক ছোট ছোট শতকরা পরিবর্তনের যোগফল log-space-এ additive — যেটা সেকশন ১১-এ উল্লেখিত সেন্ট্রাল লিমিট থিওরেম অনুযায়ী নর্মাল — আর তাই মূল স্পেসে মাল্টিপ্লিকেটিভ।
ব্যাকটেরিয়া কলোনির আকার, পার্টিকেলের আকার, বা কিছু বায়োমার্কার কনসেন্ট্রেশনের মতো কোয়ান্টিটি, যা additive না বরং মাল্টিপ্লিকেটিভলি বাড়ে, প্রায়ই লগ-নর্মাল হিসেবে মডেল করা হয়।
যখনই একটা রিয়েল-ভ্যালুড কোয়ান্টিটি স্ট্রিক্টলি পজিটিভ আর এর হিস্টোগ্রাম সিমেট্রির বদলে একটা লম্বা রাইট টেইল দেখায়, লগ-নর্মাল (বা একটা লগ-ট্রান্সফর্ম তারপর সাধারণ নর্মাল মডেলিং) ট্রাই করার মতো — এর উপর জোর করে একটা সিমেট্রিক ডিস্ট্রিবিউশন চাপানোর আগে।
মাল্টিভ্যারিয়েট নর্মাল ডিস্ট্রিবিউশন সেকশন ১১-এর পরিচিত বেল কার্ভকে একসাথে বেশ কয়েকটা র্যান্ডম ভেরিয়েবলে এক্সটেন্ড করে, শুধু প্রতিটা ভেরিয়েবলের নিজস্ব স্প্রেড না, ভেরিয়েবলগুলো একসাথে কীভাবে মুভ করে সেটাও ধরে ফেলে।
একটা মাত্র -এর বদলে, একটা মাল্টিভ্যারিয়েট নর্মাল একসাথে ভেরিয়েবলের একটা ভেক্টর বর্ণনা করে — উদাহরণ হিসেবে, একটা ডেটা পয়েন্টের উচ্চতা আর ওজন আর বয়স, সবগুলো একটা মিলিত র্যান্ডম অবজেক্ট হিসেবে মডেল করা, তিনটা আলাদা, অসম্পর্কিত জিনিসের বদলে।
একটা মাত্র মিন -এর বদলে, মাল্টিভ্যারিয়েট নর্মালের একটা মিন ভেক্টর আছে , যা প্রতিটা আলাদা ভেরিয়েবলের নিজস্ব গড় দেয়।
একটা মাত্র ভ্যারিয়েন্স -এর বদলে, এর একটা কোভ্যারিয়েন্স ম্যাট্রিক্স আছে , একটা টেবিল যার ডায়াগোনাল এন্ট্রিগুলো প্রতিটা ভেরিয়েবলের নিজস্ব ভ্যারিয়েন্স, আর অফ-ডায়াগোনাল এন্ট্রিগুলো ধরে ফেলে প্রতিটা জোড়া ভেরিয়েবল কতটা শক্তভাবে একসাথে মুভ করে (তাদের কোভ্যারিয়েন্স, Random Variables-এ ডিসক্রিট কেসের জন্য পরিচয় করানো হয়েছিল)।
নিচের জয়েন্ট-ডিস্ট্রিবিউশন প্লেগ্রাউন্ডটা ট্রাই করো — এটা সিম্পল ডিসক্রিট ক্যাটাগরি নিয়ে কাজ করে, কন্টিনিউয়াস মাল্টিভ্যারিয়েট নর্মাল ভেরিয়েবল না, কিন্তু একই ইনটুইশন তৈরি করে: ডায়াগোনাল-এর মতো মার্জিনাল প্রোবাবিলিটিগুলো প্রতিটা ভেরিয়েবল একা বর্ণনা করে, আর পুরো টেবিল (কোভ্যারিয়েন্স ম্যাট্রিক্সের ডিসক্রিট অ্যানালগ) ধরে ফেলে তারা দুইটা একসাথে কীভাবে মুভ করে।
দুইটা ভেরিয়েবলের একটা জয়েন্ট PMF বদলাও আর মার্জিনাল, কোভ্যারিয়েন্স, কোরিলেশন, আর কন্ডিশনাল প্রোবাবিলিটি লাইভ দেখো।
X and Y were generated with no relationship to each other. Edit any cell weight to explore other joint distributions.
Joint PMF — P(X = x, Y = y)
| X \ Y | 0 | 1 | P(X=x) |
|---|---|---|---|
| 0 | 0.150 | 0.100 | 0.250 |
| 1 | 0.300 | 0.200 | 0.500 |
| 2 | 0.150 | 0.100 | 0.250 |
| P(Y=y) | 0.600 | 0.400 | 1.000 |
Row X = 0
Row X = 1
Row X = 2
Conditional PMF — P(Y = y | X = x)
Y = 0
0.600
Y = 1
0.400
E[X]
1.000
E[Y]
0.400
Cov(X,Y)
0.000
Correlation
0.000
যেখানে:
বসালে মাল্টিভ্যারিয়েট নর্মাল PDF ঠিক সেকশন ১১-এর সাধারণ নর্মাল PDF-এ ফিরে আসে — মিন ভেক্টর একটা একক মিনে পরিণত হয়, আর কোভ্যারিয়েন্স ম্যাট্রিক্স একটা একক ভ্যারিয়েন্সে। একটা মাল্টিভ্যারিয়েট নর্মালের প্রতিটা মার্জিনাল (বাকিগুলো ইগনোর করে শুধু একটা ভেরিয়েবল দেখা) নিজেই একটা সাধারণ ইউনিভ্যারিয়েট নর্মাল।
একাধিক কোরিলেটেড রিয়েল-ভ্যালুড ফিচারওয়ালা যেকোনো ডেটাসেট — সেন্সর অ্যারে, ফাইন্যান্সিয়াল ইন্ডিকেটর, এমবেডিং — একসাথে একটা মাল্টিভ্যারিয়েট নর্মাল দিয়ে মডেল করা যায়, যা ফিচার কোরিলেশন ধরে ফেলে যেটা প্রতিটা ফিচারকে ইন্ডিপেন্ডেন্টলি ট্রিট করলে সম্পূর্ণ মিস হয়ে যেত।
গসিয়ান মিক্সচার মডেল (GMM) জটিল, মাল্টি-ক্লাস্টার ডেটাকে বেশ কয়েকটা মাল্টিভ্যারিয়েট নর্মাল "বাম্প"-এর ওয়েটেড যোগফল হিসেবে রিপ্রেজেন্ট করে, প্রতিটার নিজস্ব মিন ভেক্টর আর কোভ্যারিয়েন্স ম্যাট্রিক্স সহ — সেকশন ১১-এর সিঙ্গেল-বাম্প গসিয়ান আইডিয়ার একটা সরাসরি, হায়ার-ডাইমেনশনাল এক্সটেনশন, ক্লাস্টারিং আর ডেনসিটি এস্টিমেশনে ব্যাপকভাবে ব্যবহৃত।
অনেক জেনারেটিভ মডেল — Variational Autoencoders-এ ব্যবহৃত ল্যাটেন্ট-স্পেস প্রায়রসহ — তাদের ল্যাটেন্ট ভেরিয়েবলের উপর একটা মাল্টিভ্যারিয়েট নর্মাল ডিস্ট্রিবিউশন অ্যাসাম করে, বিশেষভাবে কারণ এটা স্যাম্পল করা সহজ, ভালোভাবে বোঝা যায় এমন গাণিতিক প্রোপার্টি আছে, আর (উপরের সম্পর্ক অনুযায়ী) কোরিলেশন না থাকলে সিম্পলার কেসে পরিষ্কারভাবে সংকুচিত হয়।
| তুলনা | মূল পার্থক্য |
|---|---|
| ডিসক্রিট বনাম কন্টিনিউয়াস | PMF আসল পয়েন্ট প্রোবাবিলিটি দেয়; PDF শুধু একটা রেঞ্জের উপর এরিয়া দিয়ে প্রোবাবিলিটি দেয় |
| বার্নোলি বনাম বাইনোমিয়াল | বার্নোলি একটা ট্রায়াল; বাইনোমিয়াল n ইন্ডিপেন্ডেন্ট বার্নোলি ট্রায়াল জুড়ে সাকসেস গণনা করে |
| বাইনোমিয়াল বনাম মাল্টিনোমিয়াল | বাইনোমিয়ালের 2টা ফলাফল ক্যাটাগরি; মাল্টিনোমিয়াল k ক্যাটাগরিতে জেনারালাইজ করে |
| পয়সোঁ বনাম বাইনোমিয়াল | বাইনোমিয়ালের ফিক্সড n আর প্রতি-ট্রায়াল p দরকার; পয়সোঁর শুধু একটা গড় রেট λ দরকার, কোনো ফিক্সড n না |
| জিওমেট্রিক বনাম নেগেটিভ বাইনোমিয়াল | জিওমেট্রিক ১ম সাকসেসের জন্য অপেক্ষা করে; নেগেটিভ বাইনোমিয়াল r নম্বরের জন্য অপেক্ষা করে |
| নর্মাল বনাম স্ট্যান্ডার্ড নর্মাল | স্ট্যান্ডার্ড নর্মাল হলো μ=0, σ=1 সহ একটা নির্দিষ্ট নর্মাল ডিস্ট্রিবিউশন |
| এক্সপোনেনশিয়াল বনাম গামা | এক্সপোনেনশিয়াল ১ম ইভেন্টের জন্য অপেক্ষা করে; গামা k নম্বরের জন্য অপেক্ষা করে (k-টা এক্সপোনেনশিয়ালের যোগফল) |
| নর্মাল বনাম লগ-নর্মাল | নর্মাল সিমেট্রিক; লগ-নর্মাল রাইট-স্কিউড — এটা একটা নর্মাল এক্সপোনেনশিয়েট করলে যা পাওয়া যায় |
বাইনারি ফলাফল → বার্নোলি
একটা হ্যাঁ/না, সাকসেস/ফেইলিউর ট্রায়াল।
সাকসেসের সংখ্যা → বাইনোমিয়াল
একটা ফিক্সড সংখ্যক ইন্ডিপেন্ডেন্ট ট্রায়াল জুড়ে সাকসেসের গণনা।
একাধিক ক্যাটাগরি → মাল্টিনোমিয়াল
দুইয়ের বেশি ক্যাটাগরিতে ছড়ানো গণনা।
ইভেন্ট গণনা → পয়সোঁ
শুধু একটা গড় রেট দেওয়া থাকলে, একটা ফিক্সড ইন্টারভালে বিরল ইভেন্ট কতবার ঘটে।
সাকসেস পর্যন্ত ট্রায়াল → জিওমেট্রিক
প্রথম (বা r নম্বর, নেগেটিভ বাইনোমিয়াল) সাকসেস পর্যন্ত কতগুলো অ্যাটেম্পট।
কন্টিনিউয়াস মাপ → নর্মাল
অনেক ছোট additive প্রভাব থেকে তৈরি একটা রিয়েল-ভ্যালুড মাপ।
0 আর 1-এর মাঝে প্রোবাবিলিটি → বিটা
একটা প্রোবাবিলিটি নিয়ে অনিশ্চয়তা মডেল করা।
অপেক্ষার সময় → এক্সপোনেনশিয়াল
পরের পয়সোঁ-স্টাইল ইভেন্ট পর্যন্ত কন্টিনিউয়াস সময়।
একাধিক কন্টিনিউয়াস ফিচার → মাল্টিভ্যারিয়েট নর্মাল
একসাথে মডেল করা একাধিক কোরিলেটেড রিয়েল-ভ্যালুড ভেরিয়েবল।
ইনপুট ফিচার কীভাবে ডিস্ট্রিবিউটেড সেই নিয়ে একটা মডেলের অ্যাসাম্প্শন সবকিছুকে প্রভাবিত করে — কোন preprocessing স্টেপ যুক্তিসঙ্গত (সেকশন ১২-এর StandardScaler প্রায় নর্মাল ফিচার অ্যাসাম করে) থেকে কোন অ্যালগরিদম উপযুক্ত (গসিয়ান Naive Bayes সরাসরি প্রতিটা ক্লাসের জন্য নর্মাল ফিচার অ্যাসাম করে)।
ML-এর প্রায় প্রতিটা "লস ফাংশন" আসলে গোপনে প্রেডিকশন আর আসল মানের মাঝে এরর নিয়ে একটা ডিস্ট্রিবিউশনাল অ্যাসাম্প্শন। স্কয়ার্ড এরর গসিয়ান নয়েজ অ্যাসাম করে; ক্রস-এনট্রপি ক্লাস লেবেলে বার্নোলি/মাল্টিনোমিয়াল নয়েজ অ্যাসাম করে। একটা লস ফাংশন বাছাই করা মানে একটা নয়েজ ডিস্ট্রিবিউশন বাছাই করা, সরাসরি বলা হোক বা না হোক।
ক্লাসিফিকেশন, মূলত, এস্টিমেট করা নিয়ে — দুই ক্লাসের জন্য বার্নোলি (সেকশন ৩), অনেকগুলোর জন্য মাল্টিনোমিয়াল (সেকশন ৫) — আর প্রতিটা softmax আউটপুট লেয়ার আক্ষরিক অর্থেই এই ডিস্ট্রিবিউশনগুলোর একটার প্যারামিটার তৈরি করছে।
স্ট্যান্ডার্ড লিনিয়ার রিগ্রেশন ঠিক নর্মাল-নয়েজ মডেলিং (সেকশন ১১); পয়সোঁ রিগ্রেশন (সেকশন ৬) ব্যবহার করা হয় যখন টার্গেট একটা নন-নেগেটিভ গণনা; স্ট্রিক্টলি পজিটিভ, স্কিউড টার্গেটওয়ালা মডেল প্রায়ই প্রথমে লগ-ট্রান্সফর্ম করে, ইমপ্লিসিটলি সেকশন ১৬-এর নর্মাল/লগ-নর্মাল সম্পর্কের উপর নির্ভর করে।
জেনারেটিভ মডেল ডেটা নিজে নিয়ে একটা ডিস্ট্রিবিউশন শেখে, তারপর সেখান থেকে নতুন পয়েন্ট স্যাম্পল করে। গসিয়ান মিক্সচার মডেল (সেকশন ১৭) নর্মাল বাম্পের একটা মিক্সচার থেকে ডেটা জেনারেট করে; আরও অ্যাডভান্সড জেনারেটিভ মডেল (GAN, ডিফিউশন মডেল, VAE) সবই শেষমেশ কোনো জটিল ডেটা ডিস্ট্রিবিউশন অ্যাপ্রক্সিমেট করতে শেখে, প্রায়ই একটা সিম্পল ডিস্ট্রিবিউশন (যেমন মাল্টিভ্যারিয়েট নর্মাল) থেকে শুরু করে যা স্যাম্পল করা সহজ।
বেয়েসিয়ান ML মডেল প্যারামিটারগুলোকেই র্যান্ডম ভেরিয়েবল হিসেবে ট্রিট করে, ডিস্ট্রিবিউশন সহ, যা ডেটা আসার সাথে সাথে আপডেট হয় — ঠিক সেকশন ১৫-তে বিটা-বার্নোলি কনজুগেট জোড়া দিয়ে যা প্রিভিউ করা হয়েছে, শুধু অনেক বেশি জটিল মডেল আর প্রায়রে স্কেল করা।
একটা ডিস্ট্রিবিউশনের প্যারামিটার দেওয়া থাকলে একটা ডেটাসেটের লাইকলিহুড হলো সেই প্যারামিটারের অধীনে ঠিক সেই ডেটা পর্যবেক্ষণের প্রোবাবিলিটি (PMF বা PDF) — প্যারামিটারের একটা ফাংশন হিসেবে ট্রিট করা, ডেটা ফিক্সড রেখে।
ম্যাক্সিমাম লাইকলিহুড এস্টিমেশন (MLE) সেই প্যারামিটার মান বাছাই করে যা অ্যাসাম্ড ডিস্ট্রিবিউশনের অধীনে পর্যবেক্ষিত ডেটাকে সবচেয়ে বেশি সম্ভাব্য বানায় — এটা এই চ্যাপ্টারের প্রায় প্রতিটা ডিস্ট্রিবিউশনকে আসল ডেটায় ফিট করার একক ঐক্যবদ্ধ নীতি, একটা বার্নোলির পর্যবেক্ষিত সাকসেস রেট হিসেবে এস্টিমেট করা থেকে শুরু করে, একটা নর্মালের আর স্যাম্পল মিন আর স্ট্যান্ডার্ড ডেভিয়েশন হিসেবে ফিট করা পর্যন্ত।
একটা ফিচারের ডিস্ট্রিবিউশন বোঝা কংক্রিট preprocessing চয়েসে তথ্য দেয়: ভারীভাবে রাইট-স্কিউড ফিচার (সেকশন ১৬) প্রায়ই একটা লগ ট্রান্সফর্ম থেকে উপকৃত হয়; খুব ভিন্ন স্কেলের ফিচার (সেকশন ১২) স্ট্যান্ডার্ডাইজেশন থেকে উপকৃত হয়; ফিচার যেগুলো আসলে বার্নোলি/ক্যাটাগরিক্যাল, কন্টিনিউয়াস না, সেগুলোর স্কেলিং না, এনকোডিং দরকার।
টার্গেট ভেরিয়েবলের ডিস্ট্রিবিউশন সরাসরি লস ফাংশন আর আউটপুট লেয়ার বাছাইয়ে তথ্য দেওয়া উচিত: বাইনারি টার্গেট → বার্নোলি/বাইনারি ক্রস-এনট্রপি (সেকশন ৩); মাল্টি-ক্লাস টার্গেট → মাল্টিনোমিয়াল/ক্যাটাগরিক্যাল ক্রস-এনট্রপি (সেকশন ৫); গণনা টার্গেট → পয়সোঁ লস (সেকশন ৬); রিয়েল-ভ্যালুড, মোটামুটি-সিমেট্রিক টার্গেট → গসিয়ান অ্যাসাম্প্শনের অধীনে স্কয়ার্ড এরর (সেকশন ১১)।
| পরিস্থিতি | ডিস্ট্রিবিউশন | কেন |
|---|---|---|
| কয়েন টস | বার্নোলি | একটা ট্রায়াল, দুইটা ফলাফল |
| একাধিক কয়েন টস | বাইনোমিয়াল | n ইন্ডিপেন্ডেন্ট বার্নোলি ট্রায়াল জুড়ে সাকসেস গণনা |
| ডাইস/ক্যাটাগরিক্যাল ফলাফল | মাল্টিনোমিয়াল | প্রতি ট্রায়ালে দুইয়ের বেশি সম্ভাব্য ক্যাটাগরি |
| ওয়েবসাইট ভিজিটের সংখ্যা | পয়সোঁ | একটা রেট দেওয়া থাকলে, ফিক্সড টাইম ইন্টারভালে বিরল ইভেন্টের গণনা |
| সাকসেস পর্যন্ত অ্যাটেম্পটের সংখ্যা | জিওমেট্রিক | প্রথম সাকসেস পর্যন্ত ট্রায়াল গণনা |
| মানুষের উচ্চতা | নর্মাল | অনেক ছোট additive ফ্যাক্টর দিয়ে তৈরি একটা কন্টিনিউয়াস মাপ |
| অপেক্ষার সময় | এক্সপোনেনশিয়াল | একটা কনস্ট্যান্ট রেট দেওয়া থাকলে পরের ইভেন্ট পর্যন্ত কন্টিনিউয়াস সময় |
| প্রোবাবিলিটি/প্রোপোরশন | বিটা | [0,1]-এ সীমাবদ্ধ, একটা প্রোবাবিলিটি ভ্যালু নিয়ে অনিশ্চয়তা মডেল করা |
১. উপযুক্ত ডিস্ট্রিবিউশন চিহ্নিত করো। একজন কোয়ালিটি ইন্সপেক্টর প্রোডাকশন লাইন থেকে 20টা আইটেম চেক করে, প্রতিটা ইন্ডিপেন্ডেন্টলি 0.03 প্রোবাবিলিটি দিয়ে ডিফেক্টিভ। ডিফেক্টিভ আইটেমের সংখ্যা কোন ডিস্ট্রিবিউশন দিয়ে মডেল করা হয়? (বাইনোমিয়াল, n=20, p=0.03।)
২. PMF ক্যালকুলেট করো। সহ একটা পয়সোঁ ডিস্ট্রিবিউশনের জন্য, বের করো।
৩. PDF-বেজড প্রোবাবিলিটি ক্যালকুলেট করো। -এ একটা কন্টিনিউয়াস ইউনিফর্ম ডিস্ট্রিবিউশনের জন্য, বের করো। (একটা আয়তক্ষেত্রের এরিয়া: প্রস্থ 4, উচ্চতা , তাই ।)
৪. মিন ক্যালকুলেট করো। একটা বাইনোমিয়াল ডিস্ট্রিবিউশনের , । বের করো। (।)
৫. ভ্যারিয়েন্স ক্যালকুলেট করো। একই বাইনোমিয়াল ডিস্ট্রিবিউশনের জন্য, বের করো। (।)
৬. স্ট্যান্ডার্ড ডেভিয়েশন ক্যালকুলেট করো। প্রবলেম ৫-এর ভ্যারিয়েন্স ব্যবহার করে, স্ট্যান্ডার্ড ডেভিয়েশন বের করো। (।)
৭. ডিস্ট্রিবিউশন-বেজড প্রবলেম সলভ করো। একটা ওয়েবসাইট গড়ে প্রতি ঘণ্টায় 12টা ভিজিট পায় (, পয়সোঁ)। একটা 30-মিনিটের উইন্ডোতে প্রত্যাশিত ভিজিটের সংখ্যা কত? (রেট স্কেল করো: ।)
৮. ভিন্ন ভিন্ন ডিস্ট্রিবিউশন তুলনা করো। এক লাইনে ব্যাখ্যা করো কেন একটা জিওমেট্রিক ডিস্ট্রিবিউশন "10টা কয়েন ফ্লিপে হেডসের সংখ্যা" মডেল করার জন্য অনুপযুক্ত, আর কেন বাইনোমিয়াল "প্রথম হেডস পর্যন্ত কয়েন ফ্লিপের সংখ্যা" মডেল করার জন্য অনুপযুক্ত। (জিওমেট্রিক প্রথম-সাকসেস-পর্যন্ত-ট্রায়াল মডেল করে, একটা ফিক্সড ট্রায়াল গণনা না; বাইনোমিয়ালের একটা ফিক্সড n দরকার, কিন্তু "প্রথম হেডস পর্যন্ত" এর আগে থেকে কোনো ফিক্সড স্টপিং পয়েন্ট নেই।)
৯. ডিস্ট্রিবিউশন গ্রাফ ইন্টারপ্রেট করো। আয়ের ডেটার একটা হিস্টোগ্রাম দেওয়া হলো, যার একটা লম্বা রাইট টেইল আর সব মান পজিটিভ — এই চ্যাপ্টার থেকে কোন ডিস্ট্রিবিউশন স্বাভাবিক প্রথম চয়েস, আর কেন? (লগ-নর্মাল — রাইট-স্কিউড, স্ট্রিক্টলি পজিটিভ ডেটা এর ক্লাসিক সিগনেচার, সেকশন ১৬-এ যেমন কভার করা হয়েছে।)
১০. ML-বেজড ডিস্ট্রিবিউশন প্রবলেম। একটা বাইনারি ক্লাসিফায়ার 100টা টেস্ট এক্সাম্পলের মধ্যে 91টা সঠিক প্রেডিকশন রিপোর্ট করে। সত্যিকারের অ্যাকুরেসির জন্য একটা কনফিডেন্স ইন্টারভালের পেছনে কোন ডিস্ট্রিবিউশন আছে, আর এর প্যারামিটার কী? (বাইনোমিয়াল, n=100, p এস্টিমেটেড 0.91।)
ডিসক্রিট ফাউন্ডেশন
ডিসক্রিট র্যান্ডম ভেরিয়েবলের জন্য PMF, মিন, আর ভ্যারিয়েন্স।
বার্নোলি → বাইনোমিয়াল → মাল্টিনোমিয়াল
একটা ট্রায়াল থেকে n ট্রায়াল থেকে k ক্যাটাগরিতে বিল্ড করো।
পয়সোঁ → জিওমেট্রিক → নেগেটিভ বাইনোমিয়াল
রেট-বেজড ইভেন্ট গণনা আর সাকসেসের জন্য অপেক্ষার ডিস্ট্রিবিউশন।
কন্টিনিউয়াস ফাউন্ডেশন
PDF, কার্ভের নিচের এরিয়া, আর কেন একক পয়েন্টের প্রোবাবিলিটি শূন্য।
ইউনিফর্ম → নর্মাল → স্ট্যান্ডার্ড নর্মাল
সম্পূর্ণ ফ্ল্যাট থেকে বেল কার্ভ থেকে এর ইউনিভার্সাল স্ট্যান্ডার্ডাইজড ফর্মে।
এক্সপোনেনশিয়াল → গামা
কন্টিনিউয়াস-টাইম অপেক্ষা, আর k নম্বর ইভেন্টের জন্য অপেক্ষা।
বিটা
একটা প্রোবাবিলিটিকেই একটা অনিশ্চিত কোয়ান্টিটি হিসেবে মডেল করা।
লগ-নর্মাল
একটা নর্মাল ডিস্ট্রিবিউশন এক্সপোনেনশিয়েট করলে যা পাওয়া যায়।
মাল্টিভ্যারিয়েট নর্মাল
বেল কার্ভকে একসাথে বেশ কয়েকটা কোরিলেটেড ভেরিয়েবলে এক্সটেন্ড করা।
বাছাই আর প্রয়োগ
বাস্তব পরিস্থিতিকে সঠিক ডিস্ট্রিবিউশনের সাথে মিলিয়ে ML প্র্যাকটিসের সাথে জোড়া।