Chapter 16 of 16
Every symbol and formula, in one place
পুরো HPO course জুড়ে ব্যবহৃত প্রতিটা symbol, abbreviation, আর গুরুত্বপূর্ণ formula এক জায়গায় জড়ো করা হয়েছে এখানে। কোনো সমীকরণে একটা symbol দেখে অর্থ মনে না পড়লে, বা পরীক্ষার আগে ঝটপট রিভিশনের জন্য এই পাতাটা কাজে লাগবে।
| Symbol | অর্থ |
|---|---|
| θ (theta) | Training-এর সময় শেখা model parameter-এর ভেক্টর (weight, bias, coefficient) |
| λ (lambda) | Hyperparameter-এর ভেক্টর; training শুরুর আগে বেছে নেওয়া configuration |
| λ* | সেরা hyperparameter configuration |
| θ*(λ) | নির্দিষ্ট একটা hyperparameter configuration λ দিয়ে train করে পাওয়া সেরা model parameter |
| 𝒳 (calligraphic X) | Search space — অনুমোদিত সব hyperparameter configuration-এর সেট |
| f(λ) বা L_val(λ) | λ বিন্দুতে objective function-এর মান — সাধারণত λ দিয়ে train করার পর validation loss |
| L_train(θ; λ) | নির্দিষ্ট hyperparameter λ-এর জন্য model parameter θ-এর training loss |
| L_val(θ*(λ)) | λ দিয়ে train করা সেরা মডেলের validation loss |
| η (eta) | Learning rate — gradient descent-এর step size |
| β₁, β₂ | Adam optimizer-এ প্রথম আর দ্বিতীয় moment estimate-এর জন্য exponential decay rate (default: 0.9, 0.999) |
| ε (epsilon) | Adam-এ numerical stability constant (default: 1e-8) |
| σ² (sigma squared) | Bias-variance decomposition-এ irreducible noise variance |
| μ(λ) | λ বিন্দুতে surrogate model-এর (Gaussian Process) predicted mean |
| σ(λ) | λ বিন্দুতে surrogate model-এর predicted standard deviation |
| EI(λ) | λ বিন্দুতে Expected Improvement acquisition function-এর মান |
| UCB(λ) | λ বিন্দুতে Upper Confidence Bound acquisition function-এর মান |
| k | K-fold cross-validation-এ fold সংখ্যা |
| n | Training example সংখ্যা |
| d | Hyperparameter search space-এর dimension সংখ্যা |
| T | একটা hyperparameter search-এ মোট trial (evaluation) সংখ্যা |
| Abbreviation | পূর্ণরূপ |
|---|---|
| HPO | Hyperparameter Optimization |
| ML | Machine Learning |
| DL | Deep Learning |
| NAS | Neural Architecture Search |
| AutoML | Automated Machine Learning |
| GP | Gaussian Process |
| TPE | Tree-structured Parzen Estimators |
| EI | Expected Improvement |
| UCB | Upper Confidence Bound |
| PI | Probability of Improvement |
| SMAC | Sequential Model-based Algorithm Configuration |
| BOHB | Bayesian Optimization and Hyperband |
| ASHA | Asynchronous Successive Halving Algorithm |
| fANOVA | Functional Analysis of Variance (hyperparameter importance মাপার পদ্ধতি) |
| CV | Cross-Validation |
| LOOCV | Leave-One-Out Cross-Validation |
| LR | Learning Rate |
| SGD | Stochastic Gradient Descent |
| GBM | Gradient Boosting Machine |
| RF | Random Forest |
| SVM | Support Vector Machine |
| KNN | k-Nearest Neighbors |
| LLM | Large Language Model |
নির্দিষ্ট hyperparameter configuration λ-এর জন্য সেরা model parameter খোঁজা।
যে hyperparameter configuration validation loss সবচেয়ে কম করে সেটা খোঁজা — এখানে objective-এর প্রতিটা evaluation-এর জন্যই ভেতরের loop সমাধান করতে হয়।
Gradient-এর (slope) বিপরীত দিকে η (learning rate) মাপের একটা step নেওয়া।
λ একটা hyperparameter। λ=0 বসালেই এটা সাধারণ linear regression-এ ফিরে যায়।
এখনো evaluate না করা যেকোনো বিন্দু λ-তে GP একটা Gaussian distribution বসিয়ে দেয় — μ(λ) predicted mean, σ²(λ) predicted variance (uncertainty)।
এখানে f* এখন পর্যন্ত পাওয়া সেরা objective value। EI বলে দেয় λ evaluate করলে বর্তমান সেরার তুলনায় প্রত্যাশিতভাবে কতটা উন্নতি হতে পারে।
| ধরন | উদাহরণ hyperparameter | কীভাবে sample করবেন | scikit-learn / Optuna |
|---|---|---|---|
| Continuous (uniform) | subsample ∈ [0.5, 1.0] | Uniform | uniform(0.5, 1.0) / suggest_float('sub', 0.5, 1.0) |
| Continuous (log-uniform) | learning rate ∈ [1e-5, 1e-1] | Log-uniform | loguniform(1e-5, 1e-1) / suggest_float('lr', 1e-5, 1e-1, log=True) |
| Discrete (integer) | n_estimators ∈ {50, ..., 500} | randint | randint(50, 501) / suggest_int('n', 50, 500) |
| Categorical | optimizer ∈ {Adam, SGD, RMSProp} | Choice-এর ওপর uniform | ['adam','sgd','rmsprop'] / suggest_categorical(...) |
| Conditional | kernel='rbf' হলেই শুধু gamma | Conditional | if-else-এর ভেতরে nested suggest_... / suggest_categorical + suggest_float |
| Model | সবচেয়ে গুরুত্বপূর্ণ hyperparameter | প্রস্তাবিত search range | Scale |
|---|---|---|---|
| Ridge/Lasso regression | alpha (λ) | 1e-4 থেকে 1e2 | Log-uniform |
| Logistic regression | C (inverse regularization) | 1e-4 থেকে 1e4 | Log-uniform |
| Decision tree | max_depth | 3 থেকে 20 | Linear (integer) |
| Random forest | max_depth, min_samples_leaf | max_depth: 3–20; min_samples_leaf: 1–20 | Linear (integer) |
| Gradient boosting (XGB/LGB) | learning_rate | 1e-3 থেকে 0.3 | Log-uniform |
| SVM (RBF kernel) | C এবং gamma (একসাথে) | C: 1e-2 থেকে 1e4; gamma: 1e-5 থেকে 1e1 | Log-uniform (দুটোই) |
| Neural network (যেকোনো) | learning rate | 1e-5 থেকে 1e-1 | Log-uniform |
| BERT fine-tuning | learning rate | 1e-5 থেকে 5e-5 | Log-uniform |
| CNN | learning rate, dropout | LR: 1e-4–1e-2; dropout: 0.1–0.5 | Log-uniform; linear |
| Transformer | learning rate, warmup ratio | LR: 1e-5–1e-3; warmup: 0–0.2 | Log-uniform; linear |
| ভুল | পরিণতি | সমাধান |
|---|---|---|
| Regularization strength linear grid-এ search করা | বেশিরভাগ বাজেট অপ্রাসঙ্গিক range-এ নষ্ট | Log-uniform sampling ব্যবহার করুন |
| Hyperparameter selection-এ test set ব্যবহার করা | Optimistically biased performance estimate | Test set শেষে একবারই ব্যবহার করুন |
| CV-এর আগেই পুরো dataset-এ scaler/imputer fit করা | Validation leakage — validation set-এর তথ্য preprocessing-এ ঢুকে যায় | CV loop-এর ভেতরে, শুধু training fold-এ preprocessing fit করুন |
| Batch size বদলালে learning rate না বদলানো | বাকি সব 'অপরিবর্তিত' থাকলেও performance কমে যায় | Linear scaling rule মেনে batch size-এর অনুপাতে LR বাড়ান |
| বড় learning rate দিয়ে fine-tuning করা | Catastrophic forgetting | BERT-এর জন্য LR 1e-5 থেকে 5e-5-এর মধ্যে রাখুন; warmup যোগ করুন |
| লম্বা search থেকে পাওয়া সেরা validation score রিপোর্ট করা | Validation set-এ overfitting | আলাদা চূড়ান্ত evaluation-এর পর test set performance রিপোর্ট করুন |