डेटा रीसैंपलिंग से सफल डिटेक्शंस बढ़ाना

Python में Fraud Detection

Charlotte Werger

Data Scientist

अंडरसैंपलिंग

Python में Fraud Detection

ओवरसैंपलिंग

Python में Fraud Detection

Python में ओवरसैंपलिंग

from imblearn.over_sampling import RandomOverSampler

method = RandomOverSampler() X_resampled, y_resampled = method.fit_resample(X, y)
compare_plots(X_resampled, y_resampled, X, y)

Python में Fraud Detection

Synthetic Minority Oversampling Technique (SMOTE)

1 https://www.kaggle.com/rafjaa/resampling-strategies-for-imbalanced-datasets
Python में Fraud Detection

कौन-सा रीसैंपलिंग तरीका चुनें?

  • Random Under Sampling (RUS): कुछ डेटा हटाएँ, कम्प्यूटेशनली कुशल
  • Random Over Sampling (ROS): सीधा और सरल, पर मॉडल कई डुप्लीकेट्स पर ट्रेन होता है
  • Synthetic Minority Oversampling Technique (SMOTE): अधिक परिष्कृत और यथार्थवादी डेटासेट, पर आप "fake" डेटा पर ट्रेन कर रहे हैं
Python में Fraud Detection

रीसैंपलिंग तरीकों का उपयोग कब करें

from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression

# Define resampling method and split into train and test method = SMOTE() X_train, X_test, y_train, y_test = train_test_split(X, y, train_size=0.8, random_state=0)
# Apply resampling to the training data only X_resampled, y_resampled = method.fit_resample(X_train, y_train)
# Continue fitting the model and obtain predictions model = LogisticRegression() model.fit(X_resampled, y_resampled)
# Get your performance metrics predicted = model.predict(X_test) print (classification_report(y_test, predicted))
Python में Fraud Detection

अभ्यास करते हैं!

Python में Fraud Detection

Preparing Video For Download...