19/07/2026
𝑹𝒆𝒈𝒓𝒆𝒔𝒔𝒊𝒐𝒏 𝑨𝒏𝒂𝒍𝒚𝒔𝒊𝒔 (পার্ট ২)
Regression Analysis নামটা শুনলেই অনেকের মনে হয়, এটা বুঝি খুব কঠিন একটা জিনিস। কিন্তু আসল কথা হইল, বিষয়টা যদি ধীরে ধীরে বুঝেন, তাইলে এইটা মোটেও তেমন কঠিন না। বরং ডাটার ভিতরে কী ঘটতেছে, কোন জিনিস কোনটার সাথে সম্পর্কিত, আর একটা জিনিস পরিবর্তন আরেকটা কতটুকু পরিবর্তন হয়, এইসব বোঝার জন্য Regression অনেক কাজের একটা পদ্ধতি।
Regression শুধু X বাড়লে Y বাড়ে কি না, এইটুকু বলে না। এইটা আরও বলে, সম্পর্কটা positive না negative, পরিবর্তনের পরিমাণ কত, কোন factor বেশি গুরুত্বপূর্ণ, আর আগের data ব্যবহার করে ভবিষ্যতের কোনো outcome সম্পর্কে কতটা ধারণা করা যায়।
ধরেন, একটা ব্যবসার আগের কয়েক বছরের sales, product price আর advertising cost-এর data আছে। এই data ব্যবহার কইরা আগামী মাসে sales কেমন হইতে পারে, সেইটার একটা অনুমান করা যায়। আবার rainfall, temperature, fertilizer আর soil quality-এর data থাকলে crop yield কেমন হইতে পারে, সেইটাও অনুমান করা যায়। Health research-এর ক্ষেত্রে বয়স, BMI, blood pressure, smoking status বা family history ব্যবহার কইরা কোনো রোগের risk সম্পর্কেও ধারণা করা সম্ভব।
তবে একটা কথা মনে রাখতে হইবো, prediction মানে ভবিষ্যৎ শতভাগ নিশ্চিতভাবে বলে দেওয়া না। Regression available data-এর pattern দেইখা সম্ভাব্য outcome estimate করে। অনেক সময় model পুরান data-তে ভালো result দেয়, কিন্তু নতুন data-তে গিয়া ঠিকমতো কাম করে না। এই কারণে model বানানোর সময় training data আর test data আলাদা করা লাগে। Cross-validation করা লাগে। RMSE বা MAE-এর মতো measure দিয়া দেইখা নিতে হয় predicted value আসল value থেইকা গড়ে কতটুকু দূরে আছে।
Regression explanation-এর কামেও অনেক গুরুত্বপূর্ণ। বাস্তব জীবনে কোনো result সাধারণত একটাই কারণে বদলায় না। ধরেন, আমরা জানতে চাই education level বাড়লে income বাড়ে কি না। এখন income কি শুধু education-এর কারণে বাড়ে? না। Work experience, age, occupation, skill, location, সবকিছুই income-এর উপরে প্রভাব ফেলতে পারে।
এই অবস্থায় শুধু education আর income-এর সম্পর্ক দেখলে ভুল বা অসম্পূর্ণ result আসতে পারে। তাই Multiple Regression ব্যবহার কইরা education-এর লগে experience, age আর location-এর মতো অন্য variable-ও model-এ রাখা যায়।
Model এমন হইতে পারে:
Income = β₀ + β₁Education + β₂Experience + β₃Age + β₄Location + ε
এইখানে β₁ বুঝাইবো, experience, age আর location একই থাকলে education এক unit বাড়ার লগে income গড়ে কতটুকু পরিবর্তিত হয়। এই ধরনের result-রে adjusted association বলা হয়। সহজভাবে কইলে, অন্য গুরুত্বপূর্ণ factor-এর প্রভাব মাথায় রাইখা মূল relationship দেখা হয়।
কিন্তু এইখানেই একটা বড় সাবধানতার জায়গা আছে। Regression-এ X আর Y-এর মধ্যে relationship পাওয়া গেলেই বলা যাইবো না যে X-এর কারণেই Y বদলাইছে। Relationship আর causation এক জিনিস না। Causality বুঝতে হইলে study design, সময়ের ক্রম, confounding, selection bias, measurement error আর অন্য সম্ভাব্য explanation দেখতে হইবো।
Regression coefficient relationship-এর direction আর magnitude বুঝতে সাহায্য করে। ধরেন, study hours-এর coefficient আসলো 3.2। এর মানে হইতে পারে, অন্য relevant factor একই থাকলে এক ঘণ্টা বেশি পড়াশোনার লগে পরীক্ষার নম্বর গড়ে 3.2 marks বেশি হওয়ার সম্পর্ক আছে।
Coefficient positive হইলে X বাড়ার লগে Y বাড়তে পারে। Coefficient negative হইলে X বাড়ার লগে Y কমতে পারে। আর coefficient শূন্যের কাছাকাছি হইলে relationship দুর্বল হইতে পারে।
তবে শুধু coefficient দেইখা সিদ্ধান্ত নিলে হইবো না। Confidence interval কতটা wide বা narrow, result statistically significant কি না, effect size বাস্তবে গুরুত্বপূর্ণ কি না, এইগুলাও দেখতে হইবো। কারণ একটা result statistically significant হইলেও বাস্তবে তার effect খুবই ছোট হইতে পারে। আবার sample size কম হইলে সত্যিকারের effect থাকলেও significant নাও আসতে পারে।
Regression-এর মাধ্যমে hypothesis testing-ও করা যায়। সাধারণত আমরা পরীক্ষা করি, population level-এ কোনো predictor-এর coefficient সত্যিই শূন্য থেইকা আলাদা কি না। Null hypothesis হইতে পারে:
H₀: β₁ = 0
এর মানে, X আর Y-এর মধ্যে কোনো linear association নাই।
Alternative hypothesis হইতে পারে:
H₁: β₁ ≠ 0
এর মানে, X আর Y-এর মধ্যে একটা detectable association আছে।
P-value null hypothesis-এর বিপক্ষে evidence কতটা শক্তিশালী, সেইটা বুঝতে সাহায্য করে। কিন্তু শুধু p-value দেইখা research decision নেওয়া ঠিক না। Coefficient, confidence interval, sample size, data quality, study design আর practical importance, সব একসাথে বিচার করা লাগে।
Regression-এর আরেকটা বড় কাম হইল confounding control করা। Confounder এমন একটা variable, যেইটা independent variable আর dependent variable দুইটার লগেই সম্পর্কিত থাকে এবং মূল relationship-রে ভুলভাবে দেখাইতে পারে।
ধরেন, coffee consumption আর heart disease-এর মধ্যে একটা relationship পাওয়া গেল। এখন যারা বেশি coffee খায়, তাদের মধ্যে smoking-এর হারও বেশি হইতে পারে। আবার smoking নিজেই heart disease-এর একটা বড় risk factor। তাই smoking control না করলে coffee আর heart disease-এর relationship ভুলভাবে বেশি মনে হইতে পারে।
Multiple Regression model-এ smoking, age, physical activity আর diet-এর মতো relevant factor রাখলে coffee-এর adjusted relationship পরিষ্কারভাবে বোঝা যায়। তবে মনে রাখবেন, model-এ যত বেশি variable ঢুকাইবেন, model তত ভালো হইবো, এমন কোনো কথা নাই। কোনটা confounder, কোনটা mediator, আর কোনটা collider, এইডা theory আর causal framework দিয়া বুঝতে হইবো।
Policy decision আর program evaluation-এর ক্ষেত্রেও Regression খুব বেশি ব্যবহার হয়। ধরেন, সরকার কৃষিতে subsidy দিল। এখন subsidy দেওয়ার পরে production বাড়ছে কি না, সেইটা Regression দিয়া দেখা যায়। আবার employee training দেওয়ার পরে productivity বাড়ছে কি না, public health campaign-এর পরে vaccination rate বাড়ছে কি না, এইগুলাও Regression দিয়া বিশ্লেষণ করা যায়।
কিন্তু intervention-এর আগে আর পরে result বদলাইছে দেইখাই বলা যাইবো না যে intervention-এর কারণেই পরিবর্তন হইছে। কারণ এই সময়ের মধ্যে economy, environment, অন্য policy বা participant-এর characteristic-ও বদলাইতে পারে। এজন্য control group, Difference-in-Differences, Fixed Effects Model, Interrupted Time Series বা Propensity Score Method-এর মতো design ব্যবহার করা লাগে।
Regression ভালোভাবে বুঝতে হইলে variable-এর ধরন বোঝা খুব জরুরি। Dependent Variable হইল সেই outcome, যেইটা আমরা explain বা predict করতে চাই। যেমন crop yield, income, sales, examination score, blood pressure, hospital stay বা disease status।
Independent Variable হইল সেই factor, যেইটার লগে outcome-এর relationship আমরা পরীক্ষা করি। এইডারে predictor, exposure, explanatory variable বা covariate-ও বলা হয়। যেমন fertilizer amount, study hours, advertising cost, education level, treatment status, temperature বা age।
Outcome-এর ধরন অনুযায়ী Regression model বাছাই করতে হয়। Outcome যদি continuous হয়, যেমন income বা blood pressure, তাইলে Linear Regression ব্যবহার করা যায়। Outcome যদি দুই ধরনের হয়, যেমন disease আছে বা নাই, তাইলে Logistic Regression ব্যবহার করা হয়। Outcome যদি count data হয়, যেমন একজন রোগী কয়বার hospital-এ গেছে, তাইলে Poisson বা Negative Binomial Regression ব্যবহার করা যায়। আর outcome যদি time-to-event হয়, যেমন রোগীর relapse হইতে কত সময় লাগছে, তাইলে Survival Analysis বা Cox Regression ব্যবহার করা হয়।
Simple Linear Regression-এর basic equation হইল:
Yᵢ = β₀ + β₁Xᵢ + εᵢ
এইখানে Yᵢ হইল outcome, Xᵢ হইল predictor, β₀ হইল intercept, β₁ হইল regression coefficient আর εᵢ হইল error term।
Intercept বুঝায়, X-এর মান শূন্য হইলে Y-এর estimated mean value কত। তবে X = 0 যদি বাস্তব জীবনে কোনো অর্থ না রাখে, তাইলে intercept-এর practical interpretation খুব গুরুত্বপূর্ণ নাও হইতে পারে।
Regression coefficient বুঝায়, X এক unit বাড়লে Y গড়ে কত unit পরিবর্তিত হয়। Multiple Regression-এর ক্ষেত্রে এই interpretation করার সময় model-এর অন্য variable একই আছে ধইরা নেওয়া হয়।
Error term বুঝায়, outcome-এর এমন কিছু variation আছে, যেইটা model-এর predictor দিয়া explain করা যায় নাই। এই unexplained variation আসতে পারে unmeasured factor, measurement error, individual difference, random variation বা ভুল model specification থেইকা।
Linear Regression-এ model outcome-এর variation কতটা explain করতেছে, এইডা বোঝার জন্য R² ব্যবহার করা হয়। ধরেন, R² = 0.60। এর মানে sample data-তে outcome-এর মোট variation-এর 60 শতাংশ model explain করতে পারতেছে।
তবে R² বেশি মানেই model একদম ঠিক, এইডা ভাবলে ভুল হইবো। Important confounder বাদ যাইতে পারে, relationship ভুলভাবে model করা হইতে পারে, বা overfitting থাকতে পারে। Multiple predictor থাকলে Adjusted R² অনেক সময় বেশি useful হয়, কারণ অপ্রয়োজনীয় variable যোগ করলে এইটা সহজে বাড়ে না।
Confidence interval estimate কতটা precise, সেইটা বুঝায়। ধরেন, coefficient 2.5 আর 95% confidence interval 1.2 থেইকা 3.8। এর মানে positive relationship-এর evidence আছে, কিন্তু exact effect কত, সেইখানে কিছু uncertainty আছে। Confidence interval যত narrow হইবো, estimate সাধারণত তত precise হইবো।
Regression model interpret করার আগে assumptions-ও দেখতে হইবো। Relationship linear কি না, observation independent কি না, residual-এর variance constant কি না, predictor-এর মধ্যে severe multicollinearity আছে কি না, influential outlier model-রে বেশি প্রভাবিত করতেছে কি না, এইগুলা পরীক্ষা করা দরকার।
Residual plot, Q-Q plot, Variance Inflation Factor, leverage আর Cook’s distance ব্যবহার কইরা model-এর সমস্যা ধরা যায়। শুধু software-এর table দেইখা result লিখলে অনেক সময় analysis ভুল হইতে পারে।
সব মিলাইয়া Regression Analysis মানে শুধু software-এ data ঢুকাইয়া একটা command দেওয়া না। এইডা একটা পুরো analytical process। আগে clear research question লাগবো। তারপর conceptual framework বানাইতে হইবো, variable ঠিক করতে হইবো, appropriate model নিতে হইবো, assumptions check করতে হইবো, তারপর result সাবধানে interpret করতে হইবো।
Regression আমাদের বুঝতে সাহায্য করে কোন factor outcome-এর লগে সম্পর্কিত, relationship কোন দিকে, effect কতটুকু, estimate কতটা precise আর model কতটা explain বা predict করতে পারতেছে।
সবচেয়ে গুরুত্বপূর্ণ কথা হইল, Regression সাধারণত statistical association দেখায়। Causal effect দাবি করতে হইলে strong research design, ভালো মানের data আর credible assumption দরকার।
তাই ভালো Regression Analysis মানে শুধু coefficient, p-value আর R² লিখা না। Data-এর পিছনের বাস্তব ঘটনা বুঝা, অন্য explanation চিন্তা করা, আর result এমনভাবে বলা, যাতে পাঠক বুঝতে পারে model কী বলতেছে এবং কী বলতেছে না।