Chapter 21 of 28
Where CNNs actually run in production today
"CNN" শব্দটিকে একটি সম্পূর্ণ একাডেমিক শব্দ — কার্নেল, ফিচার ম্যাপ ও ব্যাকপ্রোপাগেশন — হিসেবে দেখা খুব সহজ। তবে এর ভেতরের গণিত থেকে একটু বাইরে পা রাখলেই দেখতে পাবেন যে আমরা প্রতিদিন যেসব সফটওয়্যার ব্যবহার করি তার এক বিশাল অংশের পেছনে নিঃশব্দে কাজ করে যাচ্ছে এই CNN: যেমন আপনি শাটার বাটনে চাপ দেওয়ার আগেই ফেস বা মুখ সনাক্ত করা ক্যামেরা অ্যাপ, বারকোড ছাড়াই সবজি চিনে ফেলা বিলিং কিওস্ক, কিংবা স্ক্যান রিপোর্টে কোনো সন্দেহজনক কালো দাগ খুঁজে দেওয়া রেডিওলজিস্টের সাহায্যকারী সফটওয়্যার। এই চ্যাপ্টারটিতে গণিতের জটিলতা এড়িয়ে খুব সহজভাবে তুলে ধরা হয়েছে যে, বাস্তব জীবনের কোন কোন নির্দিষ্ট ক্ষেত্রে এই সমস্ত থিওরি বা তত্ত্বগুলো আসলে ব্যবহৃত হচ্ছে।
কোনো সুনির্দিষ্ট ইন্ডাস্ট্রির ব্যবহারে যাওয়ার আগে, ভিশন টাস্ক বা ছবি প্রসেস করার ক্ষেত্রে CNN ঠিক কী কী ধরনের কাজ সম্পাদন করে তা আলাদা করে নেওয়া দরকার — কারণ এগুলো সব একই সমস্যার ভিন্ন ভিন্ন রূপ মাত্র।
ইমেজ ক্লাসিফিকেশন (Image Classification)
পুরো ছবিতে এক বা একাধিক লেবেল বসিয়ে দেয় — যেমন কোনো ছবিতে 'বিড়াল' নাকি 'কুকুর' আছে তা নির্ধারণ করা।
অবজেক্ট ডিটেকশন (Object Detection)
ছবিতে থাকা অবজেক্টের অবস্থান বা বাউন্ডিং বক্স নির্ধারণ করে এবং তার পরিচয় শনাক্ত করে — যেমন YOLO, Faster R-CNN।
ইমেজ সেগমেন্টেশন (Image Segmentation)
প্রতিটি পিক্সেলকে আলাদাভাবে ক্লাসিফাই করে (semantic segmentation) অথবা প্রতিটি অবজেক্ট ইনস্ট্যান্সকে আলাদা করে (instance segmentation) — যেমন Mask R-CNN, U-Net।
ফেস রিকগনিশন (Face Recognition)
কোনো ব্যক্তির চেহারা চেনার জন্য ফেসিয়াল এম্বেডিং (embeddings) বিশ্লেষণ করে পরিচয় নিশ্চিত করে।
মেডিকেল ইমেজিং (Medical Imaging)
এক্স-রে, এমআরআই, সিটি স্ক্যান ও রেটিনা স্ক্যান থেকে টিউমার, ফ্র্যাকচার বা ডায়াবেটিক রেটিনোপ্যাথি সনাক্ত করে।
স্বয়ংক্রিয় গাড়ি (Autonomous Vehicles)
রিয়েল-টাইম ক্যামেরা ফিড থেকে লেন, পথচারী, গাড়ি ও ট্রাফিক সাইন সনাক্ত করে।
কৃষিকাজ (Agriculture)
ড্রোন বা স্যাটেলাইট ইমেজারি থেকে ফসলের রোগ ও আগাছা সনাক্ত করে এবং ফলন অনুমান করে।
স্যাটেলাইট ইমেজিং (Satellite Imaging)
ভূমি ব্যবহারের শ্রেণীবিভাগ, বন উজাড় পর্যবেক্ষণ এবং দুর্যোগের ক্ষয়ক্ষতি মূল্যায়ন।
ম্যানুফ্যাকচারিং (Manufacturing)
প্রোডাকশন লাইনে স্বয়ংক্রিয় ভিজ্যুয়াল ত্রুটি ও গুণগত মান পরিদর্শন।
নিরাপত্তা ও নজরদারি (Security & Surveillance)
CCTV ফুটেজে অস্বাভাবিকতা এবং অনুপ্রবেশকারী বা অস্ত্র সনাক্তকরণ।
ওসিআর (OCR)
স্ক্যান করা ডকুমেন্ট, নম্বর প্লেট ও রসিদ থেকে ছাপা বা হাতে লেখা টেক্সট পড়ে।
কম্পিউটার ভিশনের যেকোনো কাজকে ঢালাওভাবে "ক্লাসিফিকেশন" বলে দেওয়া একটি খুব সাধারণ ভুল ধারণা। Classification উত্তর দেয় "এই ছবিতে কী আছে?" Detection উত্তর দেয় "এই ছবিতে কী আছে, এবং কোথায় — একটি বাউন্ডিং বক্স সহ?" Segmentation সবচেয়ে সূক্ষ্ম প্রশ্নের উত্তর দেয় — "ঠিক কোন কোন পিক্সেল কোন অবজেক্টের অংশ?" কোনো নির্দিষ্ট ব্যবহারের জন্য ভুল পদ্ধতি বেছে নেওয়া (যেমন পিক্সেল-লেভেল টিউমার সীমানা দরকার হওয়া সত্ত্বেও শুধু classification ব্যবহার করা) একটি ডিজাইনগত ভুল, শুধু কোনো টেকনিক্যাল খুঁটিনাটি নয়।
ওপরের কাজের ক্ষেত্রগুলো বিভিন্ন শিল্প বা ইন্ডাস্ট্রির প্রয়োজনে সম্পূর্ণ ভিন্ন ভিন্ন প্রোডাক্টের রূপ নেয় — একই পেছনের "ছবিতে অবজেক্ট চেনা"-র ক্ষমতা প্রসঙ্গের ওপর ভিত্তি করে চমৎকার সব বৈচিত্র্যময় প্রোডাক্টে পরিণত হয়।
স্বাস্থ্যসেবা (Healthcare)
radiology ছবি থেকে স্বয়ংক্রিয় রোগ নির্ণয় সহায়তা; চর্মরোগের ছবি থেকে স্কিন ক্যানসার সনাক্তকরণ।
খুচরা ব্যবসা ও ই-কমার্স
ভিজ্যুয়াল সার্চ ('একই রকম প্রোডাক্ট খুঁজুন'), স্বয়ংক্রিয় চেকআউট, শেলফ-স্টক মনিটরিং।
ব্যাংকিং ও ফিন্যান্স (Banking / Finance)
চেক ও হাতের লেখা শনাক্তকরণ, আইডি ডকুমেন্ট ভেরিফিকেশন, ফ্রড প্যাটার্ন সনাক্তকরণ।
অটোমোটিভ (Automotive)
অ্যাডভান্সড ড্রাইভার অ্যাসিস্ট্যান্স সিস্টেম (ADAS) এবং সেলফ-ড্রাইভিং পারসেপশন স্ট্যাক।
এগ্রি-টেক (Agriculture Tech)
প্রিসিশন ফার্মিং — কীটপতঙ্গ ও রোগ সনাক্তকরণ, স্বয়ংক্রিয় ফসল সংগ্রহকারী রোবট।
সোশ্যাল মিডিয়া (Social Media)
কনটেন্ট মডারেশন, অটো-ট্যাগিং, এবং ছবি অনুসন্ধান।
ম্যানুফ্যাকচারিং / ইন্ডাস্ট্রি ৪.০
প্রোডাকশন লাইনে অ্যাসেম্বলি ও ত্রুটি সনাক্তকরণের জন্য রোবোটিক ভিশন।
নিরাপত্তা ও প্রতিরক্ষা
ফেসিয়াল রিকগনিশন অ্যাক্সেস কন্ট্রোল এবং স্যাটেলাইট নজরদারি বিশ্লেষণ।

ইন্টারভিউ বা পরীক্ষায় যখন আপনাকে "বাস্তব জীবনের একটি উদাহরণ" দিতে বলা হবে, তখন সর্বদা একটি সুনির্দিষ্ট ও জনপ্রিয় প্রজেক্টের নাম নিন — যেমন "Tesla Autopilot তার পারসেপশন স্ট্যাকে লেন ও অবজেক্ট সনাক্ত করার জন্য CNN-ভিত্তিক মডেল ব্যবহার করে" অথবা "Google Photos uses CNNs for automatic face grouping and tagging" — ঢালাওভাবে "CNN স্বয়ংক্রিয় গাড়িতে ব্যবহৃত হয়" বলার চেয়ে এটি আপনার গভীর জ্ঞান ফুটিয়ে তোলে।
এর আগের চ্যাপ্টারগুলোতে CNN কীভাবে কাজ করে তা কভার করা হয়েছে; এই চ্যাপ্টারটি একটি স্মরণ করিয়ে দেওয়া যে এসবের গুরুত্ব আসলে কোথায়। ভিজ্যুয়াল ডেটার সংস্পর্শে আসা প্রায় প্রতিটি ইন্ডাস্ট্রিতে — স্বাস্থ্যসেবা, খুচরা ব্যবসা, ফিন্যান্স, কৃষিকাজ, নিরাপত্তা, ম্যানুফ্যাকচারিং — এখন তাদের পাইপলাইনের কোথাও না কোথাও একটি CNN-আকৃতির টুল বসানো আছে, প্রায়ই অদৃশ্যভাবে, যা প্রতি সেকেন্ডে হাজার হাজার বার ইনফারেন্স চালায় এমন ইনফ্রাস্ট্রাকচারে যা বেশিরভাগ ব্যবহারকারী কখনো ভাবেই না। এই পুরো ল্যান্ডস্কেপটি বোঝাই "আমি জানি কনভোলিউশন কীভাবে কাজ করে" থেকে "আমি জানি কোথায় CNN কাজে লাগানো উচিত, আর কোথায় অন্য কোনো টুল বেশি ভালো কাজ করবে" — এই পার্থক্যটি তৈরি করে।