Přehled hyperparametrů Isolation Forest

Detekce anomálií v Pythonu

Bekhruz (Bex) Tuychiev

Kaggle Master, Data Science Content Creator

Nejdůležitější hyperparametry

Hyperparametry s největším vlivem na IForest:

  • contamination
  • n_estimators
  • max_samples
  • max_features
Detekce anomálií v Pythonu

Co je contamination?

Jak IForest klasifikuje datové body:

  1. Jsou vygenerovány hrubé skóre anomálií
  2. Nastaví se práh zvaný contamination
  3. Nejvyšší procento skóre anomálií označených hodnotou contamination jsou vybrány jako odlehlé body
Detekce anomálií v Pythonu

Nastavení contamination

from pyod.models.iforest import IForest


# Accepts a value between 0 and 0.5 iforest = IForest(contamination=0.05)
Detekce anomálií v Pythonu

Co je n_estimators?

# More trees for larger datasets
iforest = IForest(n_estimators=1000)

iforest.fit(airbnb_df)
Detekce anomálií v Pythonu

max_samples a max_features

iforest = IForest(n_estimators=200, max_samples=0.6, max_features=0.9)


iforest.fit(airbnb_df)
Detekce anomálií v Pythonu

Růst stromů

  • iStromy:
    • rostou náhodným způsobem
    • rozdělení je náhodně vybráno mezi min a max příznaků
    • rostou, dokud:
      • nejsou všechny body izolovány
      • není dosaženo maximální hloubky
Detekce anomálií v Pythonu

Maximální hloubka stromu

  • Rovna se logaritmu velikosti vzorku
Detekce anomálií v Pythonu

Výhody IForest

  • Velmi efektivní na velkých datasetech
  • Nepotřebuje všechny normální instance jako jiné algoritmy
  • Žádné statistické předpoklady
  • Funguje dobře bez nastavení
Detekce anomálií v Pythonu

Výzvy detekce odlehlých hodnot

  • Modely řízeného učení využívají metriky jako RMSE nebo log loss
  • Detekce odlehlých hodnot je problém neřízeného učení
  • Klasifikátory odlehlých hodnot by měly být kombinovány s modely řízeného učení
Detekce anomálií v Pythonu

Pojďme cvičit!

Detekce anomálií v Pythonu

Preparing Video For Download...