डेटा संग्रह में पक्षपात कम करना
डेटा बायस पर विजय
Konstantinos Kattidis
Data Analytics Lead
डेटा संग्रह में पक्षपात पहचानना
- चयन पक्षपात, ऐतिहासिक पक्षपात और मापन पक्षपात
- इन पक्षपातों को समझने से जागरूकता बढ़ती है, जिससे डेटा विशेषज्ञ इन्हें सक्रिय रूप से पहचान सकें और कार्रवाई कर सकें

- Sensitivity analysis अलग-अलग धारणाओं, वैकल्पिक उपसमूहों, या वेटिंग रणनीतियों का परिणामों पर प्रभाव जाँचती है
- External validation स्वतंत्र स्रोतों से तुलना कर स्थिरता और शुद्धता जाँचती है
Random और stratified sampling
- उपयुक्त सैंपलिंग तकनीक चुनना महत्वपूर्ण है
- Random sampling में जनसंख्या से व्यक्तियों या डेटा पॉइंट्स का यादृच्छिक चयन होता है
- Stratified sampling जनसंख्या को उपसमूहों में बाँटकर प्रत्येक से सैंपल चुनती है
उपसमूह प्रतिनिधित्व संतुलित करना
- Oversampling वितरण संतुलित करने के लिए कुछ समूहों/क्लासों का प्रतिनिधित्व जानबूझकर बढ़ाता है
- Undersampling अधिक-प्रतिनिधित्व वाले समूहों को घटाकर डेटासेट अधिक संतुलित बनाता है
- Weighting में प्रेक्षणों को महत्त्व के अनुसार अलग-अलग वेट दिए जाते हैं, ताकि सैंपल वितरण की असंतुलन की भरपाई हो सके
डेटा ऑग्मेंटेशन
- ऐतिहासिक पक्षपात से निपटने के लिए, यह तकनीक अतिरिक्त डेटा पॉइंट्स से डेटासेट समृद्ध करती है
- लक्ष्य है कम-प्रतिनिधित्व वाली अवधियों या घटनाओं को कवर करना
- इसमें शामिल है:
- डेटा गैप भरना
- नज़रियों का विविधीकरण
- अपडेट करना और त्रुटियाँ सुधारना
डेटा मापन प्रथाएँ

- मापन टूल्स और प्रोटोकॉल का मानकीकरण
- डेटा कलेक्टर्स का प्रशिक्षण और कैलिब्रेशन
- पायलट टेस्टिंग से डेटा संग्रह प्रक्रियाओं की शुद्धता और स्थिरता आँकी जा सकती है
- नियमित क्वालिटी एश्योरेंस जाँचें और प्रक्रियाओं का ऑटोमेशन डेटा गुणवत्ता और बढ़ाते हैं
निरंतर मॉनिटरिंग और समायोजन
- नए उभरते पक्षपात से निपटने के लिए सतत मॉनिटरिंग और समायोजन ज़रूरी हैं
- डेटा क्वालिटी मैट्रिक्स की नियमित समीक्षा
- पक्षपात आकलन
- ये पक्षपात की तुरंत पहचान संभव बनाते हैं
अभ्यास करते हैं!
डेटा बायस पर विजय
Preparing Video For Download...