Credit Risk Modeling in Python
Michael Crabtree
Data Scientist, Ford Motor Company
0.86loan_status hodnoty 1 označuje selhání, 0 neselhání0.86loan_status hodnoty 1 označuje selhání, 0 neselhání| Pravděpodobnost selhání | Interpretace | Predikovaný stav úvěru |
|---|---|---|
| 0,4 | Selhání nepravděpodobné | 0 |
| 0,90 | Selhání velmi pravděpodobné | 1 |
| 0,1 | Selhání velmi nepravděpodobné | 0 |
0 a 1from sklearn.linear_model import LogisticRegression
clf_logistic = LogisticRegression(solver='lbfgs')
.fit()clf_logistic.fit(training_columns, np.ravel(training_labels))
loan_statusloan_status (0, 1)| Podmnožina dat | Použití | Podíl |
|---|---|---|
| Trénovací | Učení z dat pro generování predikcí | 60 % |
| Testovací | Testování modelu na nových datech | 40 % |
X = cr_loan.drop('loan_status', axis = 1)
y = cr_loan[['loan_status']]
train_test_split() ze scikit-learnX_train, X_test, y_train, y_test = train_test_split(X, y, test_size=.4, random_state=123)
test_size: podíl dat pro testovací sadurandom_state: hodnota náhodného seedu pro reprodukovatelnostCredit Risk Modeling in Python