模型回顧與比較

用 Python 透過機器學習預測 CTR

Kevin Huo

Instructor

模型回顧

from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier
from sklearn.neural_network import MLPClassifier
  • 邏輯斯迴歸:線性分類器,找出決策邊界
  • 決策樹:以樹狀條件表示
  • 隨機森林:多棵決策樹的集成
  • 類神經網路(MLP):以特徵線性組合搭配非線性啟動函式的多層結構
用 Python 透過機器學習預測 CTR

模型實作

相同點
  • 特徵轉換與正規化
  • classifier.fit(X_train, y_train) 訓練
  • predict_proba()predict() 做預測
不同點
  • 決策樹:max_depthmin_samples_split
  • 隨機森林:n_estimatorsoob_score
  • 邏輯斯迴歸:fit_interceptclass_weight
  • 類神經網路:hidden_layer_sizesmax_iter
用 Python 透過機器學習預測 CTR

模型評估

  • 主要評估指標:
    • 混淆矩陣:confusion_matrix(y_test, y_pred)
    • 精確率(Precision):precision_score(y_test, y_pred)
    • 召回率(Recall):recall_score(y_test, y_pred)
    • F-beta 分數:fbeta_score(y_test, y_pred, beta = 0.5)
    • ROC 曲線下的 AUC:roc_auc_score(y_test, y_score[:, 1])
用 Python 透過機器學習預測 CTR

使用類神經網路的主要利弊

優點

  • 隨資料量可擴展
  • 對特徵工程需求較低
  • 跨領域可移轉性高

缺點

  • 在小型資料集上威力較弱
  • 可解釋性差
  • 計算與成本較高
用 Python 透過機器學習預測 CTR

一起來練習吧!

用 Python 透過機器學習預測 CTR

Preparing Video For Download...