Pythonで学ぶ木ベースのMachine Learning
Elie Kawerk
Data Scientist
【決定木】: ノードの階層からなるデータ構造。
【ノード】: 質問または予測。
ノードは3種類:
【根】: 親なし。質問により子ノードが2つ。
【内部ノード】: 親が1つ。質問により子ノードが2つ。
【葉】: 親が1つ。子なし → 予測。



ノードの不純度 $I (node)$ の指標:
ノードは再帰的に成長させる。
各ノードで次により分割:
$IG (\text{node})$=0 の場合、そのノードを葉とする。
...
# Import DecisionTreeClassifier
from sklearn.tree import DecisionTreeClassifier
# Import train_test_split
from sklearn.model_selection import train_test_split
# Import accuracy_score
from sklearn.metrics import accuracy_score
# Split dataset into 80% train, 20% test
X_train, X_test, y_train, y_test= train_test_split(X, y,
test_size=0.2,
stratify=y,
random_state=1)
# Instantiate dt, set 'criterion' to 'gini'
dt = DecisionTreeClassifier(criterion='gini', random_state=1)
# Fit dt to the training set
dt.fit(X_train,y_train)
# Predict test-set labels
y_pred= dt.predict(X_test)
# Evaluate test-set accuracy
accuracy_score(y_test, y_pred)
0.92105263157894735
Pythonで学ぶ木ベースのMachine Learning