Chapter 14 of 18
Six complete, end-to-end projects across forecasting, NLP, and more
এই চ্যাপ্টারে আমরা এই কোর্সে শেখা প্রতিটি বিষয় — ডেটা প্রিপারেশন, মডেল বিল্ডিং, মূল্যায়ন এবং হাইপারপ্যারামিটার অপ্টিমাইজেশন — তিনটি সম্পূর্ণ প্রজেক্টের মাধ্যমে বাস্তব ক্ষেত্রে প্রয়োগ করব। প্রতিটি প্রজেক্টে আমরা একই নিয়মতান্ত্রিক ধাপগুলো অনুসরণ করব: ডেটাসেট সংগ্রহ, এক্সপ্লোরেটরি ডেটা অ্যানালাইসিস (EDA), ক্লিনিং, প্রি-প্রসেসিং, মডেল ট্রেনিং, মূল্যায়ন, এরর অ্যানালাইসিস এবং সবশেষে মডেল সংরক্ষণ ও লোড করা। এটি আপনাকে স্পষ্টভাবে বুঝতে সাহায্য করবে যে কীভাবে একই ডেটা-ওয়ার্কফ্লো তিনটি সম্পূর্ণ ভিন্ন কাজের উপযোগী করে মানিয়ে নেওয়া যায়।
ডেটাসেট সম্পর্কে একটি নোট: নিচের প্রজেক্টগুলোতে আমরা বাস্তব ডেটার কাঠামোর ওপর ভিত্তি করে সিন্থেটিক ডেটা (synthetic data) তৈরি করে ব্যবহার করেছি যাতে ইন্টারনেট সংযোগ ছাড়াই কোডগুলো সরাসরি রান করা যায়। প্রতিটি সেকশনে আমরা আসল প্রজেক্টে ব্যবহৃত ক্যানোনিকাল ডেটাসেটটির নামও উল্লেখ করে দিয়েছি; কোডের পরিবর্তন হবে খুবই সামান্য — কেবল ডেটা লোড করার ধাপটিতে।
বাস্তব ডেটাসেট: IMDB Movie Reviews (keras.datasets.imdb), যেখানে ৫০,০০০ লেবেলযুক্ত মুভি রিভিউ রয়েছে।
বাস্তব ডেটাসেট: যেকোনো প্লেইন টেক্সট কর্পাস — শেক্সপিয়ারের নাটক, সংবাদের আর্টিকেল কিংবা উইকিপিডিয়া টেক্সট।
টেম্পারেচার < ১.০: মডেল বেশি সুনির্দিষ্ট বা ডিটারমিনিস্টিক আচরণ করে এবং সর্বোচ্চ আত্মবিশ্বাসী শব্দগুলোই পছন্দ করে। টেম্পারেচার > ১.০: মডেল অনেক বেশি ক্রিয়েটিভ কিন্তু মাঝে মাঝে অসংলগ্ন শব্দ তৈরি করতে পারে। টেম্পারেচার = ১.০: সরাসরি মডেলের শেখা ডিস্ট্রিবিউশন থেকে স্যাম্পলিং করা হয়।
বাস্তব ডেটাসেট: UCI Household Electric Power Consumption, কিংবা যেকোনো শেয়ার/আবহাওয়ার CSV ফাইল।