डेटा तैयारी

एंड-टू-एंड मशीन लर्निंग

Joshua Stapleton

Machine Learning Engineer

डेटा तैयारी के स्टेप्स

डेटासेट में हैं:

  • Missing values
  • Outliers
  • Imbalances
  • खाली कॉलम
  • डुप्लिकेट्स

डेटा तैयारी:

  • EDA से मिली इनसाइट्स पर आधारित
  • आगे मॉडल परफॉर्मेंस के लिए महत्वपूर्ण
एंड-टू-एंड मशीन लर्निंग

Null / खाली मान

  • Missing या sparse पंक्तियाँ/कॉलम ड्रॉप करें
  • Null values मॉडल तोड़ सकते हैं
  • कॉलम के लिए df.drop() उपयोग करें
  • पंक्तियों के लिए df.dropna(how='all') उपयोग करें
# count missing values
print(df['oldpeak'].isnull().sum())

# Drop empty column(s) and row(s)
columns_dropped = heart_disease_df.drop(['oldpeak'], axis='columns')
rows_and_columns_dropped = columns_dropped.dropna(how='all')
एंड-टू-एंड मशीन लर्निंग

Null/खाली मानों से निपटना

  • डेटा क्लीनिंग/ड्रॉपिंग EDA के नतीजों पर निर्भर है

 

  • यदि किसी कॉलम में बहुत ज़्यादा missing values हों:
    • कॉलम ड्रॉप करें

 

  • यदि target कॉलम में missing values हों:
    • missing target वाली पंक्तियाँ ड्रॉप करें
    • या इसे अलग कैटेगरी की तरह ट्रीट करें
एंड-टू-एंड मशीन लर्निंग

Imputation

जब केवल कुछ ही missing values हों तो क्या करें?

  • Imputation:

    • missing values को विकल्पों से भरें
  • स्ट्रैटेजीज़

    • mean या median से भरें
    • constant या पिछले मान से भरें
# Calculate the mean cholestrol value 
mean_value = heart_disease_df['chol'].mean()

# Fill missing cholestrol values with the mean
heart_disease_df['chol'].fillna(mean_value, inplace=True)
एंड-टू-एंड मशीन लर्निंग

एडवांस्ड इम्प्यूटेशन

एडवांस्ड तकनीकें:

  • K-nearest neighbors
  • SMOTE (synthetic minority oversampling technique)
from sklearn.impute import KNNImputer

# Initialize KNNImputer
imputer = KNNImputer(n_neighbors=2, weights="uniform")

# Perform the imputation on your DataFrame
df_imputed['oldpeak'] = imputer.fit_transform(df['oldpeak'])
एंड-टू-एंड मशीन लर्निंग

डुप्लिकेट्स ड्रॉप करना

 

  • डेटा साफ, संक्षिप्त और समृद्ध होना चाहिए
  • फालतू दोहराव मददगार नहीं
  • डुप्लिकेट्स मॉडल को बायस्ड या कन्फ्यूज़ कर सकते हैं
  • रिकॉर्ड/पंक्तियाँ ड्रॉप करने के लिए unique identifiers देखें

 

# Drop duplicate rows
heart_disease_duplicates_dropped = heart_disease_column_dropped.drop_duplicates()
एंड-टू-एंड मशीन लर्निंग

अभ्यास करते हैं!

एंड-टू-एंड मशीन लर्निंग

Preparing Video For Download...