01/05/2026
⚠️ রিসার্চ ডেটা এনালাইসিসের আগে এই ৭টি বিষয় না জানলে বিপদ! 📉
ডেটা এনালাইসিস শুরু করার আগে সবচেয়ে গুরুত্বপূর্ণ ধাপ হলো **Raw Data Cleaning & Pre-processing**। কারণ অপরিষ্কার (unclean) ডেটা আপনার পুরো গবেষণার ফলাফলকে ভুল করে দিতে পারে।
চলুন জেনে নেই—এই ধাপে কী কী করতে হয় 👇
📍 ১. Missing Values Handling
অনেক সময় অংশগ্রহণকারীরা কিছু প্রশ্নের উত্তর না দিয়েই ফর্ম সাবমিট করে।
🔹 উদাহরণ: ২০ জন শিক্ষার্থী তাদের ওজন উল্লেখ করেনি।
✅ সমাধান:
• Row বাদ দেওয়া (যদি সংখ্যা কম হয়)
• Mean/Median দিয়ে ফাঁকা পূরণ (Imputation)
• Advanced prediction (Regression/ML)
📍 ২. Duplicate Data Removal
একই ব্যক্তি একাধিকবার ডেটা দিলে ফলাফল bias হয়ে যায়।
🔹 উদাহরণ: একই Student_ID দুইবার আছে
✅ সমাধান: Unique ID (Email/ID) দিয়ে duplicate remove করুন
📍 ৩. Outlier Detection
অস্বাভাবিক বড়/ছোট মানগুলো বিশ্লেষণকে বিকৃত করে।
🔹 উদাহরণ: সবার বয়স ১৮–২৮, কিন্তু কেউ লিখেছে ৭০
✅ সমাধান:
• Identify (Boxplot/Z-score)
• Correct বা Remove
📍 ৪. Data Type Correction
সংখ্যা অনেক সময় Text হিসেবে থেকে যায়
🔹 উদাহরণ: "65 kg" → Numeric নয়
✅ সমাধান: Unit সরিয়ে pure number এ convert করুন
📍 ৫. Data Coding
Categorical ডেটাকে numeric করতে হয়
🔹 উদাহরণ:
• Male = 1, Female = 2
• Low = 1, Middle = 2, High = 3
📍 ৬. Variable Transformation
নতুন ইনসাইট পেতে নতুন ভেরিয়েবল তৈরি করা হয়
🔹 উদাহরণ: Height + Weight → BMI
📍 ৭. Handling Inconsistencies
একই ডেটা বিভিন্নভাবে লেখা হলে সমস্যা হয়
🔹 উদাহরণ: Cumilla / Comilla / COMILA
✅ সমাধান: Standardize করুন
💡 মনে রাখবেন:
👉 “Garbage in, Garbage out” — ডেটা যত ক্লিন, রেজাল্ট তত নির্ভুল।
আপনি যদি Research, Thesis বা Data Science নিয়ে কাজ করেন, তাহলে এই স্টেপগুলো কখনোই স্কিপ করবেন না।
আরও এমন কনটেন্ট পেতে ফলো রাখুন! 🤝