डेटा का परीक्षण

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Sinan Ozdemir

Data Scientist, Entrepreneur, and Author

डेटा वैलिडेशन और स्कीमा टेस्ट

  • डेटा वैलिडेशन टेस्ट मिसिंग वैल्यू, असंगतियाँ, और असामान्य डेटा खोजते हैं
    • जैसे, आउट्लायर खोजना
  • स्कीमा टेस्ट अपेक्षित डेटा फॉर्मेट और डेटा टाइप जाँचते हैं

    • जैसे, सुनिश्चित करें कि "time to value" सेकंड में इंटीजर हो, मिनट में नहीं
  • Great Expectations जैसे टूल इस प्रक्रिया को ऑटोमेट करने में मदद करते हैं

great expectations logo

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

साधारण परीक्षण से आगे

  • डेटा और स्कीमा टेस्ट बुनियादी समस्याएँ पकड़ते हैं
  • और जटिल टेस्ट जैसे एक्स्पेक्टेशन टेस्ट जटिल मुद्दे ढूँढते हैं
    • जाँचें कि वैल्यू किसी तय रेंज में हैं या नहीं
    • ज्ञात पैटर्न/ट्रेंड की जाँच
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Expectation टेस्ट

  • डेटा वैलिडेशन टेस्ट का एक प्रकार
  • सुनिश्चित करें कि डेटा यूज़र या सिस्टम द्वारा परिभाषित कुछ "expectations" से मेल खाता है
    • जैसे, वेबसाइट पर बिताया समय लगभग 4 मिनट हो, 1 मिनट का स्टैंडर्ड डिविएशन के साथ
    • जैसे, किसी मरीज की पिछली विज़िट की तारीखें वर्तमान समय से पहले हों
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

फीचर इम्पॉर्टेंस टेस्ट

  • फीचर इम्पॉर्टेंस टेस्ट एक ML मॉडल में सबसे अहम फीचर पहचानते हैं
  • उदाहरण: Permutation importance
    • फीचर वैल्यू को रैंडम तरीके से बदलें और देखें मॉडल का परफॉर्मेंस कितना घटता है

bar chart

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Permutation importance का उदाहरण

सेटअप:

import numpy as np
from sklearn.ensemble import RandomForestClassifier
from sklearn.inspection import permutation_importance
# Train a random forest classifier (assuming we have some data)
model = RandomForestClassifier().fit(X_train, y_train)

हमारा permutation importance टेस्ट चलाना:

# Calculate feature importances using permutation importance
results = permutation_importance(model, X_test, y_test, n_repeats=10, random_state=42)
# Print the feature importances
feature_names = ['feature_1', 'feature_2', 'feature_3', ...]
importances = results.importances_mean
for i in range(len(feature_names)):
    print(f'{feature_names[i]}: {importances[i]}')
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

डेटा ड्रिफ्ट की जाँच

डेटा ड्रिफ्ट

  • इसे कभी-कभी फीचर ड्रिफ्ट भी कहते हैं
  • मॉडल के इनपुट डेटा के वितरण में बदलाव
  • जैसे, लोग किसी नए प्रोडक्ट के लिए नया शब्द ज़्यादा इस्तेमाल करने लगें और चैटबॉट कन्फ्यूज़ हो जाए

लेबल ड्रिफ्ट

  • लेबल वितरण में बदलाव
  • जैसे, लोग रिटर्न माँगने से हटकर रिटर्न की स्थिति पूछने लगें
प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

अभ्यास करते हैं!

प्रोडक्शन के लिए मशीन लर्निंग मॉडल विकसित करना

Preparing Video For Download...