모델 검토 및 비교

Python으로 Machine Learning을 활용한 CTR 예측

Kevin Huo

Instructor

모델 검토

from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
from sklearn.ensemble import RandomForestClassifier
from sklearn.neural_network import MLPClassifier
  • 로지스틱 회귀: 결정 경계를 학습하는 선형 분류기
  • 결정 트리: 조건의 트리 구조
  • 랜덤 포레스트: 결정 트리 앙상블
  • 신경망(MLP): 비선형 활성화가 있는 선형 결합 층
Python으로 Machine Learning을 활용한 CTR 예측

모델 구현

공통점
  • 특성 변환과 정규화
  • classifier.fit(X_train, y_train)으로 학습
  • predict_proba()predict()로 예측
차이점
  • 결정 트리: max_depth, min_samples_split
  • 랜덤 포레스트: n_estimators, oob_score
  • 로지스틱 회귀: fit_intercept, class_weight
  • 신경망: hidden_layer_sizes, max_iter
Python으로 Machine Learning을 활용한 CTR 예측

모델 평가

  • 주요 평가 지표:
    • 혼동 행렬: confusion_matrix(y_test, y_pred)
    • 정밀도: precision_score(y_test, y_pred)
    • 재현율: recall_score(y_test, y_pred)
    • F-beta 점수: fbeta_score(y_test, y_pred, beta = 0.5)
    • ROC 곡선 AUC: roc_auc_score(y_test, y_score[:, 1])
Python으로 Machine Learning을 활용한 CTR 예측

신경망 사용의 주요 장단점

장점

  • 데이터에 따른 확장성
  • 피처 엔지니어링 필요성 감소
  • 도메인 간 전이 용이

단점

  • 소규모 데이터에서 성능 낮음
  • 해석이 어려움
  • 계산 및 비용 부담 큼
Python으로 Machine Learning을 활용한 CTR 예측

연습해 봅시다!

Python으로 Machine Learning을 활용한 CTR 예측

Preparing Video For Download...