Přehled a porovnání modelů

Předpovídání CTR pomocí Machine Learning v Pythonu

Kevin Huo

Instructor

Přehled modelů

from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier
from sklearn.neural_network import MLPClassifier
  • Logistická regrese: lineární klasifikátor určující rozhodovací hranici
  • Rozhodovací stromy: podmínky ve stromové struktuře
  • Náhodné lesy: soubor rozhodovacích stromů
  • Neuronové sítě (MLP): vrstvy využívající lineární kombinace příznaků s nelineární aktivační funkcí
Předpovídání CTR pomocí Machine Learning v Pythonu

Implementace modelů

Podobnosti
  • Transformace příznaků a regularizace
  • Trénování pomocí classifier.fit(X_train, y_train)
  • Predikce pomocí predict_proba() a predict()
Rozdíly
  • Rozhodovací stromy: max_depth, min_samples_split
  • Náhodné lesy: n_estimators, oob_score
  • Logistická regrese: fit_intercept, class_weight
  • Neuronové sítě: hidden_layer_sizes, max_iter
Předpovídání CTR pomocí Machine Learning v Pythonu

Hodnocení modelů

  • Klíčové metriky hodnocení:
    • Matice záměn: confusion_matrix(y_test, y_pred)
    • Přesnost: precision_score(y_test, y_pred)
    • Úplnost: recall_score(y_test, y_pred)
    • F-beta skóre: fbeta_score(y_test, y_pred, beta = 0.5)
    • AUC křivky ROC: roc_auc_score(y_test, y_score[:, 1])
Předpovídání CTR pomocí Machine Learning v Pythonu

Hlavní výhody a nevýhody neuronových sítí

Výhody

  • Škálovatelnost s daty
  • Menší potřeba přípravy příznaků
  • Lépe přenositelné napříč oblastmi

Nevýhody

  • Slabší výkon na menších datových sadách
  • Obtížná interpretovatelnost
  • Výpočetně a finančně náročnější
Předpovídání CTR pomocí Machine Learning v Pythonu

Pojďme si procvičit!

Předpovídání CTR pomocí Machine Learning v Pythonu

Preparing Video For Download...