27/06/2026
ကြောင်းကျိုးဆက်နွယ်မှုကို လေ့လာမှု သုတေသနပညာ အပိုင်း(၈)
**********************
ယခုပို့စ်မှာ အကြောင်းနှင့်အကျိုးဆက်နွယ်မှုကို လေ့လာပြီး ဖော်ထုတ်တင်ပြရာတွင် အသုံးပြုကြသည့်” Regression Analysis” ထဲက “nominal regression” အကြောင်းကို တင်ပြပါမည်။
Nominal Logistic Regression ဆိုသည်မှာ လွတ်လပ်ကိန်းရှင်တစ်ခုသည် နာမကိန်း (သို့) အုပ်စုကိန်း(Categorical Data) ဖြစ်နေသည့် မှီခိုကိန်း (Dependent Variable) တစ်ခု အပေါ် သက်ရောက်မှု (သို့မဟုတ်) ဖြစ်နိုင်ခြေ (Probability) ကို တွက်ချက်ရန် အသုံးပြုရသည့် Statistical Model ဖြစ်သည်။ ၎င်းကို ကိန်းဂဏန်းပုံစံ တစ်သမတ်တည်း မဟုတ်သော “Non-linear” အခြေအနေများတွင် အဓိကအားဖြင့် အသုံးပြုပါသည်။
ဤစနစ်တွင် မှီခိုကိန်းကို တိုင်းတာသည့် “ categorical scale” ကို သတ်မှတ်ရာတွင် (က) နှစ်ခု (ခ) နှစ်ခုထက်များသည့် အုပ်စုအပေါ် မူတည်၍ Binary သို့မဟုတ် nominal logistic regression ဟု သုံးနှုန်းကြသည်။
Binary logistic regression နှင့် nominal logistic regression ဟု သုံးနှုန်းခြင်းနှင့် ပတ်သက်ပြီး အနည်းငယ်ရှင်းပြပါမည်။
(က) Binary Logistic Regression ကို မှီခိုပြောင်းလဲကိန်းတွင် အုပ်စု နှစ်ခုသာရှိသည့် အခြေအနေ (ဥပမာ- ဆေးဝါးအောင်မြင်မှု ရှိ/မရှိ၊ ဝန်ထမ်းအလုပ်ထွက်/မထွက် ကဲ့သို့သော Dichotomous Data မျိုး) တွင် အသုံးပြုပြီး၊
(ခ) Nominal (or Multinomial) Logistic Regression ကိုမူ အုပ်စု သုံးခုနှင့်အထက် ရှိသည့် အခြေအနေ (ဥပမာ- ဝန်ထမ်းများ နှစ်သက်သည့် ရာထူးတိုးမြှင့်မှုပုံစံ - လစာတိုးခြင်း၊ အပိုဆုကြေးပေးခြင်း သို့မဟုတ် ခွင့်ရက်ပေးခြင်း) ) တွင် အသုံးပြုသည်။
သို့သော် အထက် အမျိုးစားနှစ်ခုလုံးတွင် လွတ်လပ်ကိန်းရှင်များ (Independent Variables) မှာမူ Continuous scale, ordinal scale (သို့မဟုတ်) Categorical scale စသည်ဖြင့် အမျိုးမျိုး ဖြစ်နိုင်ပါသည်။
ဥပမာ (၁)
လစဉ် ဝင်ငွေ (Monthly Income)၊လက်ရှိ တင်ရှိနေသော ကြွေးမြီပမာဏ (Current Debt)၊ အကြွေးဆပ်ဖူးသည့် သမိုင်းကြောင်း ရမှတ် (Credit Score) တို့သည် ချေးငွေ ပျက်ကွက်မှု အခြေအနေ (Default Status) ( 0="Default" ပြန်မဆပ်ဘဲ ပျက်ကွက်သည်)၊ 1="Pay" ပုံမှန် ပြန်လည်ပေးဆပ်သည်) အပေါ် သက်ရောက်မှု (သို့မဟုတ်) ဖြစ်နိုင်ခြေ (Probability) ကို တွက်ချက်ကြည့်ခြင်း။ ဤနေရာတွင် လွတ်လပ်ကိန်းရှင်များကို “Continuous scale” ဖြင့် တိုင်းတာထားသော်လည်း မှီခိုကိန်းကိုမူ “ categorical scale” ဖြင့်သာ တိုင်းတာထားပြီး အုပ်စု (၂)ခုသာ ပါရှိသည့်ကို တွေ့ရမည်။ ထို့ကြောင့် ဤ စနစ်ကို “ Binary logistic regression” ဖြင့် စစ်ဆေးရမည်။
ဥပမာ(၂)
နမူနာလူဦးရေထဲက လူတစ်ယောက်ဟာ Fast Food စားသုံးမှုအပေါ် မူတည်ပြီး Obese ဖြစ်မလား၊ Not Obese ဖြစ်မလားဆိုတဲ့ Categorical အုပ်စု (၂) ခုထဲက တစ်ခုခုထဲသို့ ကျရောက်နိုင်ခြေ (Probability) ကို ခန့်မှန်းကြည့်လိုသည်။ ထို့ကြောင့် ၎င်းတို့၏ တစ်ပတ်လျှင် Fast Food စားသည့် အကြိမ်ရေ (Continuous)၊ တစ်နေ့တာ ကိုယ်လက်လှုပ်ရှားမှု မိနစ် (Continuous) တို့သည် ၎င်းတို့၏ အဝလွန်ခြင်း အခြေအနေ (Obesity Status= 1.Obese (အဝလွန်သည်) သို့မဟုတ် 0. Not Obese (အဝမလွန်ပါ) အပေါ် သက်ရောက်မှု (သို့မဟုတ်) ဖြစ်နိုင်ခြေ (Probability) ကို တွက်ချက်ကြည့်ခြင်း။ ဤနေရာတွင် လွတ်လပ်ကိန်းရှင်များကို “Continuous scale” ဖြင့် တိုင်းတာထားသော်လည်း မှီခိုကိန်းကိုမူ “ categorical scale” ဖြင့်သာ တိုင်းတာထားပြီး အုပ်စု (၂)ခုသာ ပါရှိသည့်ကို တွေ့ရမည်။ ထို့ကြောင့် ဤ စနစ်ကို “ Binary logistic regression” ဖြင့် စစ်ဆေးရမည်။
ဥပမာ(၃)
ယဉ်ပိတ်ဆို့မှုကြာမြင့်ချိန် (မိနစ်)၊ သွားရမည့်ခရီး၏ ကြာမြင့်ချိန်( မိနစ်) ပြောင်းလဲမှုအပေါ် မူတည်ပြီး ခရီးသွားပြည်သူများအနေဖြင့် မည်သည့် လမ်းကြောင်းရွေးချယ်မှု( ပထမလမ်း၊ ဒုတိယလမ်းကြောင်း၊ တတိယလမ်းကြောင်း) ကို ရွေးချယ်ကြသနည်းဆိုသည်ကို လေ့လာခြင်း။ ဤနေရာတွင် လွတ်လပ်ကိန်းရှင်များကို “Continuous scale” ဖြင့် တိုင်းတာထားသော်လည်း မှီခိုကိန်းကိုမူ “ categorical scale” ဖြင့်သာ တိုင်းတာထားပြီး အုပ်စု (၃)ခုသာ ပါရှိသည့်ကို တွေ့ရမည်။ ထို့ကြောင့် ဤ စနစ်ကို “multinominal logistic regression” ဖြင့် စစ်ဆေးရမည်။
-----------
ပြည့်စုံရမည့် “ Assumption များ
***************
၁။ မှီခိုကိန်း( Dependent variable) သည် “ categorical scale” ဖြင့် တိုင်းတာရမည်ဖြစ်ပြီး၊ အုပ်စု (၂)ခု သို့မဟုတ် ယင်းထက်ပမာဏများနိုင်သည်။
၂။ လွတ်လပ်ကိန်းရှင် ( Independent variable) ကို မည်သည့်ကိန်းဖြင့်မဆို တိုင်းတာနိုင်သည်။
၃။ Independence of Observations (အချက်အလက်များ အမှီအခိုကင်းခြင်း) ဖြစ်ရမည်။ ( ကောက်ယူထားသော နမူနာ (Case သို့မဟုတ် Respondent) တစ်ခုချင်းစီသည် တစ်ခုနှင့်တစ်ခု လွှမ်းမိုးမှုမရှိဘဲ သီးခြားစီ ဖြစ်ရပါမည်ဟု ဆိုလိုသည်)
၄။ Absence of Multicollinearity (လွတ်လပ်သောကိန်းရှင်များအကြား ဆက်စပ်မှုမရှိခြင်း) ဖြစ်ရမည်။ ဆိုလိုသည်မှာ Independent Variables (IVs) အချင်းချင်းကြားထဲမှာ အလွန်အမင်း နီးကပ်စွာ ဆက်စပ်နေခြင်း (High correlation) မရှိရပါ။၎င်းကို Variance Inflation Factor (VIF) ကို စစ်ဆေးရပါမည်။ ယေဘုယျအားဖြင့် VIF>5 (သို့မဟုတ် 10) ဖြစ်နေပါက Multicollinearity ရှိနေတတ်သည်ဟု ဆုံးဖြတ်ပါသည်။
၅။ Linearity of Independent Variables and Log Odds (Linear ဖြစ်တည်မှု ) ရှိရမည်။ ဆိုလိုသည်မှာ Logistic Regression သည် DV (Categorical) နှင့် IV များ တိုက်ရိုက် Linear ဖြစ်ရန်မလိုပါ။ သို့သော် Continuous IV များနှင့် DV ရဲ့ Log-Odds (Logit Transformation) အကြားမှာတော့ Linear relationship (မျဉ်းဖြောင့်ဆက်စပ်မှု) ရှိရပါမည်။
၆။ normality ဖြစ်ရန် မလိုအပ်ပါ။
-------------------
မည်သည့်အရာများကို အဓိက ကြည့်ရှုစစ်ဆေးရသနည်း
****************
အဓိကအားဖြင့် (၁) Model တစ်ခုလုံး ကောင်းမွန်မှု ရှိမရှိ (Model Fit)၊ (၂) Predictor တွေက တကယ် လွှမ်းမိုးမှု ရှိမရှိ (Significance) နဲ့ (၃) မည်မျှအထိ လွှမ်းမိုးမှုရှိသလဲ (Effect Size/Odds Ratio) ဆိုတဲ့ အချက်ကြီး (၃) ချက်ကို ကြည့်ပြီး ဆုံးဖြတ်ရပါသည်။ တစ်ခုချင်းစီ၏ သဘောသဘာဝကို ဆက်လက်လေ့လာကြပါမည်။
၁။ Model တစ်ခုလုံး ကောင်းမွန်မှု ရှိမရှိ (Model Fit)
************
မော်ဒယ်တစ်ခု ကောင်းမွန်မှုကို မတိုင်းတာခင် စာရင်းအင်းပညာမှာ Baseline Model (Intercept-only Model) နဲ့ အရင် နှိုင်းယှဉ်ရသည်။
(က) Baseline Model ဆိုသည်မှာ မည်သည့် Independent Variable (IV) မှ model ထဲတွင် မထည့်ရသေးခင် Dependent Variable (DV) ၏ ပျမ်းမျှအခြေအနေသက်သက်ကိုသာ ကြည့်ပြီး ခန့်မှန်းထားတဲ့ မော်ဒယ်ဖြစ်သည်။ ဥပမာအားဖြင့် ဘဏ်တစ်ခုမှာ ချေးငွေလျှောက်သူ 80% က ပုံမှန်ပြန်ဆပ်ပြီး 20% က Default ဖြစ်တတ်လျှင် ၊ လျှောက်လာသမျှလူတိုင်းကို "ပုံမှန်ဆပ်မည့်သူ" ဟု ခန့်မှန်းလိုက်ခြင်းမျိုးဖြစ်သည်။
(ခ) Model Fit ဖြစ်ခြင်း ဆိုသည်မှာ မိမိလေ့လာချင်သည့် independent variable (IV) များ ( ဥပမာ- ဝင်ငွေ၊ Credit Score စသည့်အရာများ) ကို model ထဲသို့ ထည့်သွင်းပြီး တွက်ချက်လိုက်သည့် အခါ အဆိုပါ baseline model တွင် ခန့်မှန်းချက်ထက် ပိုမိုတိကျမှန်ကန်စွာ ခန့်မှန်းနိုင်စွမ်း ရှိလာခြင်း ကို ဆိုလိုခြင်းဖြစ်သည်။ ၎င်းတွင် အောက်ပါ အချက်အလက်များကို စစ်ဆေးရပါသည်။
(က) Omnibus Tests of Model Coefficients (or Likelihood Ratio Test): * ၎င်း၏ p-value (Sig.) ကို ကြည့်ရပါမည်။ ထွက်ပေါ်လာသည့် p-value သည် p0.05 ဖြစ်ရပါမည်။ (Non-significant ဖြစ်ရမည်)။ စာရင်းအင်းစစ်ဆေးမှုတွေမှာ p0.05 ဖြစ်ပါက ခန့်မှန်းချက်နှင့် လက်တွေ့ဒေတာအကြား သိသာထင်ရှားသော ကွဲလွဲမှု မရှိတော့ကြောင်း (Model ၏ ဖြစ်နိုင်ခြေ ခန့်မှန်းချက်များသည် လက်တွေ့ ဖြစ်ရပ်များနှင့် ကောင်းမွန်စွာ ထပ်တူကျ ကိုက်ညီနေကြောင်း ဆုံးဖြတ်ပါသည်။
-----------
(ဂ) Pseudo R^2 (Cox & Snell R^2 နှင့် Nagelkerke R^2)
************
ဤကိန်းသည် Linear Regression မှာကဲ့သို့ R^2 အစစ်မဟုတ်ဘဲ ခန့်မှန်းခြေတွက်ထားခြင်းဖြစ်သောကြောင့် Pseudo R^2 လို့ ခေါ်သည်။ ။ ဥပမာအားဖြင့် Nagelkerke R^2=0.35 ဆိုလျှင် Independent variables များသည် Dependent variable ၏ ဖြစ်နိုင်ခြေပေါင်းလဲမှုမှုပုံစံ (Variance) ကို 35% အထိ ရှင်းလင်းခန့်မှန်းပေးနိုင်သည်ဟု အဓိပ္ပာယ်ရပါသည်။ အကယ်၍ Nagelkerke R^2=0.42 ဟု ထွက်လာပါက မိမိထည့်သွင်းထားသော Independent Variables များသည် Dependent Variable ၏ ဖြစ်နိုင်ခြေ ပြောင်းလဲမှုပုံစံ (Variance) ကို 42% အထိ အချိုးကျ ရှင်းလင်းပြသနိုင်စွမ်း ရှိသည်ဟု ကောက်ချက်ချ ဆုံးဖြတ်နိုင်ပါသည်။
--------------
၂။ ကိန်းရှင်တစ်ခုချင်းစီ၏ လွှမ်းမိုးမှုကို ဆုံးဖြတ်ခြင်း (Variables in the Equation)
************
ဤနေရာသည် Model ထဲမှာပါတဲ့ IV တစ်ခုချင်းစီသည် DV အပေါ် အမှန်တကယ် သက်ရောက်မှု ရှိမရှိကို ကြည့်ရသည့် အပိုင်း ဖြစ်သည်။
ဤနေရာတွင် -
(က) p-value (Sig. of Wald Test) ကို ကြည့်ရပါမည်။ထွက်ပေါ်လာသည့် IV တစ်ခုချင်းစီ၏ p-value က 0.05 အောက် ငယ်ရပါမည် (p1 ဖြစ်လျှင် (Positive Relationship) - IV တိုးလာတာနဲ့အမျှ DV (1) ဖြစ်ပွားဖို့ အခွင့်အလမ်း ပိုများလာမည်။
ဥပမာအားဖြင့် မားကတ်တင်း ကဏ္ဍတွင် Time on Site (ဝက်ဘ်ဆိုက်ပေါ်နေချိန်) ၏ "Exp" (B)=1.25 ဖြစ်ပါက၊ ဝက်ဘ်ဆိုက်ပေါ်တွင် ၁ မိနစ် ပိုနေတိုင်း ဝယ်ယူရန် (1="Buy" ) အခွင့်အလမ်း 25% ပိုများလာသည်ဟု ဆုံးဖြတ်သည်။ [(1.25-1)×100%=25%]
(ခ)"Odds Ratio"