Python में क्रेडिट रिस्क मॉडलिंग
Michael Crabtree
Data Scientist, Ford Motor Company
loan_status की डिफॉल्ट प्रॉबेबिलिटी के लिए एक साधारण डिसीजन ट्री| Loan | True loan status | Pred. Loan Status | Loan payoff value | Selling Value | Gain/Loss |
|---|---|---|---|---|---|
| 1 | 0 | 1 | $1,500 | $250 | -$1,250 |
| 2 | 0 | 1 | $1,200 | $250 | -$950 |
xgboost Python पैकेज का हिस्सा, यहाँ xgb कहा गया है.fit() से ट्रेन होता है, ठीक लॉजिस्टिक रिग्रेशन की तरह# Create a logistic regression model
clf_logistic = LogisticRegression()
# Train the logistic regression
clf_logistic.fit(X_train, np.ravel(y_train))
# Create a gradient boosted tree model
clf_gbt = xgb.XGBClassifier()
# Train the gradient boosted tree
clf_gbt.fit(X_train,np.ravel(y_train))
.predict() और .predict_proba() दोनों से प्रेडिक्ट करता है.predict_proba() 0 और 1 के बीच मान देता है.predict() loan_status के लिए 1 या 0 देता है# Predict probabilities of default
gbt_preds_prob = clf_gbt.predict_proba(X_test)
# Predict loan_status as a 1 or 0
gbt_preds = clf_gbt.predict(X_test)
# gbt_preds_prob
array([[0.059, 0.940], [0.121, 0.989]])
# gbt_preds
array([1, 1, 0...])
learning_rate: छोटा मान हर स्टेप को अधिक conservative बनाता हैmax_depth: हर ट्री की अधिकतम गहराई, बड़ा मतलब ज्यादा जटिलxgb.XGBClassifier(learning_rate = 0.2,
max_depth = 4)
Python में क्रेडिट रिस्क मॉडलिंग