डिफॉल्ट प्रायिकता के लिए Logistic regression

Python में क्रेडिट रिस्क मॉडलिंग

Michael Crabtree

Data Scientist, Ford Motor Company

डिफॉल्ट की प्रायिकता

  • किसी के लोन डिफॉल्ट करने की संभावना को डिफॉल्ट की प्रायिकता कहते हैं
  • 0 और 1 के बीच प्रायिकता, जैसे 0.86
  • loan_status में 1 डिफॉल्ट और 0 नॉन-डिफॉल्ट दर्शाता है
Python में क्रेडिट रिस्क मॉडलिंग

डिफॉल्ट की प्रायिकता

  • किसी के लोन डिफॉल्ट करने की संभावना को डिफॉल्ट की प्रायिकता कहते हैं
  • 0 और 1 के बीच प्रायिकता, जैसे 0.86
  • loan_status में 1 डिफॉल्ट और 0 नॉन-डिफॉल्ट दर्शाता है
डिफॉल्ट की प्रायिकता अर्थ अनुमानित loan status
0.4 डिफॉल्ट की संभावना कम 0
0.90 डिफॉल्ट की संभावना बहुत अधिक 1
0.1 डिफॉल्ट की संभावना बहुत कम 0
Python में क्रेडिट रिस्क मॉडलिंग

प्रायिकताएँ भविष्यवाणी करना

  • मशीन लर्निंग से आउटपुट के रूप में डिफॉल्ट की प्रायिकताएँ
    • कॉलम्स (features) के डेटा से सीखें
  • क्लासिफिकेशन मॉडल (डिफॉल्ट, नॉन-डिफॉल्ट)
  • दो सबसे आम मॉडल:
    • Logistic regression
    • Decision tree

Logistic regression और decision tree का उदाहरण

Python में क्रेडिट रिस्क मॉडलिंग

Logistic regression

  • Linear regression जैसा, लेकिन केवल 0 और 1 के बीच मान देता है

Linear regression और logistic regression का सूत्र

Linear regression और logistic regression का उदाहरण ग्राफ़

Python में क्रेडिट रिस्क मॉडलिंग

Logistic regression को ट्रेन करना

  • scikit-learn पैकेज में Logistic regression उपलब्ध है
from sklearn.linear_model import LogisticRegression
  • पैरामीटर्स के साथ या बिना फंक्शन की तरह कॉल करें
clf_logistic = LogisticRegression(solver='lbfgs')
  • ट्रेनिंग के लिए .fit() मेथड उपयोग करें
clf_logistic.fit(training_columns, np.ravel(training_labels))
  • Training Columns: हमारे डेटा के वे सभी कॉलम्स, सिवाय loan_status के
  • Labels: loan_status (0,1)
Python में क्रेडिट रिस्क मॉडलिंग

ट्रेनिंग और टेस्टिंग

  • पूरा डेटासेट आम तौर पर दो भागों में बाँटा जाता है
Python में क्रेडिट रिस्क मॉडलिंग

ट्रेनिंग और टेस्टिंग

  • पूरा डेटासेट आम तौर पर दो भागों में बाँटा जाता है
डेटा सबसेट उपयोग हिस्सा
Train प्रेडिक्शन सीखने के लिए डेटा से सीखें 60%
Test नए, अनदेखे डेटा पर सीख को जाँचें 40%
Python में क्रेडिट रिस्क मॉडलिंग

ट्रेनिंग और टेस्ट सेट बनाना

  • डेटा को ट्रेनिंग कॉलम्स और लेबल्स में बाँटें
X = cr_loan.drop('loan_status', axis = 1)
y = cr_loan[['loan_status']]
  • scikit-learn में मौजूद train_test_split() फंक्शन का उपयोग करें
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=.4, random_state=123)
  • test_size: टेस्ट सेट के लिए डेटा का प्रतिशत
  • random_state: पुनरुत्पादन के लिए रैंडम सीड वैल्यू
Python में क्रेडिट रिस्क मॉडलिंग

अभ्यास करते हैं!

Python में क्रेडिट रिस्क मॉडलिंग

Preparing Video For Download...