XGBoost 的正则化与基学习器

使用 XGBoost 的极端梯度提升

Sergey Fogelson

Head of Data Science, TelevisaUnivision

XGBoost 中的正则化

  • 正则化用于控制模型复杂度
  • 期望模型既准确又尽量简单
  • XGBoost 的正则化参数:
    • gamma:分裂所需的最小损失下降
    • alpha:叶节点权重的 L1 正则,值越大正则越强
    • lambda:叶节点权重的 L2 正则
使用 XGBoost 的极端梯度提升

XGBoost 中的 L1 正则示例

import xgboost as xgb
import pandas as pd
boston_data = pd.read_csv("boston_data.csv")
X,y = boston_data.iloc[:,:-1],boston_data.iloc[:,-1]

boston_dmatrix = xgb.DMatrix(data=X,label=y) params={"objective":"reg:squarederror","max_depth":4}
l1_params = [1,10,100] rmses_l1=[]
for reg in l1_params: params["alpha"] = reg cv_results = xgb.cv(dtrain=boston_dmatrix, params=params,nfold=4, num_boost_round=10,metrics="rmse",as_pandas=True,seed=123) rmses_l1.append(cv_results["test-rmse-mean"].tail(1).values[0])
print("Best rmse as a function of l1:") print(pd.DataFrame(list(zip(l1_params,rmses_l1)), columns=["l1","rmse"]))
Best rmse as a function of l1:
        l1          rmse
    0    1  69572.517742
    1   10  73721.967141
    2  100  82312.312413
使用 XGBoost 的极端梯度提升

XGBoost 的基学习器

  • 线性基学习器:
    • 线性项之和
    • 提升模型为线性模型的加权和(仍为线性)
    • 很少使用
  • 树基学习器:
    • 决策树
    • 提升模型为决策树的加权和(非线性)
    • 在 XGBoost 中几乎专用
使用 XGBoost 的极端梯度提升

由多组等长列表创建 DataFrame

  • pd.DataFrame(list(zip(list1,list2)),columns=["list1","list2"]))
  • zip 创建并行值的 generator
    • zip([1,2,3],["a","b""c"]) = [1,"a"],[2,"b"],[3,"c"]
    • generators 需先完全实例化,方可用于 DataFrame
  • 使用 list() 实例化生成器,再传入 DataFrame 完成转换
使用 XGBoost 的极端梯度提升

Passons à la pratique !

使用 XGBoost 的极端梯度提升

Preparing Video For Download...