前向きステップワイズ変数選択

Pythonで学ぶ予測分析入門

Nele Verbiest, Ph.D

Data Scientist @PythonPredictions

前向きステップワイズ変数選択の手順

  • 空集合からスタート
  • 最適な変数 $v_1$ を選択
  • $v_1$ との組み合わせで最適な $v_2$ を選択
  • $v_1, v_2$ との組み合わせで最適な $v_3$ を選択
  • ...

(全変数の追加、または指定数の変数の追加まで繰り返す)

Pythonで学ぶ予測分析入門

Pythonの関数

def function_sum(a,b):

s = a + b return(s)
print(function_sum(1,2))
3
Pythonで学ぶ予測分析入門

前向きステップワイズ手順の実装

  • 指定した変数セットのAUCを計算する関数 auc
  • 現在の変数との組み合わせで次の最適変数を返す関数 best_next
  • 目的の変数数になるまでループ
Pythonで学ぶ予測分析入門

AUC関数の実装

from sklearn import linear_model
from sklearn.metrics import roc_auc_score

def auc(variables, target, basetable):

X = basetable[variables] y = basetable[target]
logreg = linear_model.LogisticRegression() logreg.fit(X, y)
predictions = logreg.predict_proba(X)[:,1] auc = roc_auc_score(y, predictions) return(auc)
auc = auc(["age","gender_F"],["target"],basetable)
print(round(auc,2))
0.54
Pythonで学ぶ予測分析入門

次の最適変数の計算

def next_best(current_variables,candidate_variables, target, basetable):

best_auc = -1 best_variable = None
for v in candidate_variables: auc_v = auc(current_variables + [v], target, basetable)
if auc_v >= best_auc: best_auc = auc_v best_variable = v
return best_variable
current_variables = ["age","gender_F"] candidate_variables = ["min_gift","max_gift","mean_gift"] next_variable = next_best(current_variables, candidate_variables, basetable) print(next_variable)
min_gift
Pythonで学ぶ予測分析入門

前向きステップワイズ変数選択の手順

candidate_variables = ["mean_gift","min_gift","max_gift",
"age","gender_F","country_USA","income_low"]
current_variables = []
target = ["target"]

max_number_variables = 5 number_iterations = min(max_number_variables, len(candidate_variables)) for i in range(0,number_iterations):
next_var = next_best(current_variables,candidate_variables,target,basetable)
current_variables = current_variables + [next_variable] candidate_variables.remove(next_variable)
print(current_variables)
['max_gift', 'mean_gift', 'min_gift', 'age', 'gender_F']
Pythonで学ぶ予測分析入門

練習しましょう!

Pythonで学ぶ予測分析入門

Preparing Video For Download...