Przegląd i porównanie modeli

Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Kevin Huo

Instructor

Przegląd modeli

from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier
from sklearn.neural_network import MLPClassifier
  • Regresja logistyczna: liniowy klasyfikator wyznaczający granicę decyzyjną
  • Drzewa decyzyjne: warunki w formacie drzewa
  • Lasy losowe: zespół drzew decyzyjnych
  • Sieci neuronowe (MLP): warstwy używające liniowych kombinacji cech z nieliniową funkcją aktywacji
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Implementacja modeli

Podobieństwa
  • Transformacja cech i regularyzacja
  • Dopasowanie przez classifier.fit(X_train, y_train)
  • Predykcje przez predict_proba() i predict()
Różnice
  • Drzewa decyzyjne: max_depth, min_samples_split
  • Lasy losowe: n_estimators, oob_score
  • Regresja logistyczna: fit_intercept, class_weight
  • Sieci neuronowe: hidden_layer_sizes, max_iter
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Ocena modeli

  • Kluczowe metryki oceny:
    • Macierz pomyłek: confusion_matrix(y_test, y_pred)
    • Precyzja: precision_score(y_test, y_pred)
    • Czułość: recall_score(y_test, y_pred)
    • Miara F-beta: fbeta_score(y_test, y_pred, beta = 0.5)
    • Pole pod krzywą ROC: roc_auc_score(y_test, y_score[:, 1])
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Główne zalety i wady sieci neuronowych

Zalety

  • Skalowalność wraz z danymi
  • Mniejsza potrzeba inżynierii cech
  • Lepsza przenośność między domenami

Wady

  • Słabsze działanie na małych zbiorach danych
  • Trudność interpretacji
  • Niższy koszt obliczeniowy i finansowy
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Czas na ćwiczenia!

Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Preparing Video For Download...