Wartości odstające w danych kredytowych

Modelowanie ryzyka kredytowego w Pythonie

Michael Crabtree

Data Scientist, Ford Motor Company

Przetwarzanie danych

  • Przetworzone dane umożliwiają szybsze trenowanie modeli
  • Często pozytywnie wpływają na wydajność modelu

Wykres ROC dla trzech różnych modeli

Modelowanie ryzyka kredytowego w Pythonie

Wartości odstające a wydajność

Możliwe przyczyny wartości odstających:

  • Błędy w systemach wprowadzania danych (błąd ludzki)
  • Problemy z narzędziami do importu danych
Modelowanie ryzyka kredytowego w Pythonie

Wartości odstające a wydajność

Możliwe przyczyny wartości odstających:

  • Błędy w systemach wprowadzania danych (błąd ludzki)
  • Problemy z narzędziami do importu danych
Cecha Współczynnik z wartościami odstającymi Współczynnik bez wartości odstających
Oprocentowanie 0.2 0.01
Długość zatrudnienia 0.5 0.6
Dochód 0.6 0.75
Modelowanie ryzyka kredytowego w Pythonie

Wykrywanie wartości odstających za pomocą tabel krzyżowych

  • Użyj tabel krzyżowych z funkcjami agregującymi
pd.crosstab(cr_loan['person_home_ownership'], cr_loan['loan_status'],
            values=cr_loan['loan_int_rate'], aggfunc='mean').round(2)

Modelowanie ryzyka kredytowego w Pythonie

Wizualne wykrywanie wartości odstających

Wizualne wykrywanie wartości odstających

  • Histogramy
  • Wykresy punktowe

Wykres punktowy długości zatrudnienia i oprocentowania kredytu

Modelowanie ryzyka kredytowego w Pythonie

Usuwanie wartości odstających

  • Użyj metody .drop() w bibliotece Pandas
indices = cr_loan[cr_loan['person_emp_length'] >= 60].index
cr_loan.drop(indices, inplace=True)

Wykres punktowy oprocentowania i długości zatrudnienia bez wartości odstających

Modelowanie ryzyka kredytowego w Pythonie

Czas na ćwiczenia!

Modelowanie ryzyka kredytowego w Pythonie

Preparing Video For Download...