Machine Learning avec des modèles à base d'arbres en Python
Elie Kawerk
Data Scientist
Chap. 1 : Classification And Regression Tree (CART)
Chap. 2 : compromis biais-variance
Chap. 3 : ensachage et forêts aléatoires
Chap. 4 : rehaussement (boosting)
Chap. 5 : réglage de modèle
Suite de questions if-else sur des variables individuelles.
Objectif : déduire les étiquettes de classe.
Capte les relations non linéaires entre variables et étiquettes.
Ne nécessite pas d'échelonnage des variables (ex. : standardisation, …)


# Import DecisionTreeClassifier from sklearn.tree import DecisionTreeClassifier # Import train_test_split from sklearn.model_selection import train_test_split # Import accuracy_score from sklearn.metrics import accuracy_score# Split the dataset into 80% train, 20% test X_train, X_test, y_train, y_test= train_test_split(X, y, test_size=0.2, stratify=y, random_state=1)# Instantiate dt dt = DecisionTreeClassifier(max_depth=2, random_state=1)
# Fit dt to the training set dt.fit(X_train,y_train) # Predict the test set labels y_pred = dt.predict(X_test)# Evaluate the test-set accuracy accuracy_score(y_test, y_pred)
0.90350877192982459
Région de décision : zone de l'espace des variables où toutes les instances reçoivent la même étiquette de classe.
Frontière de décision : surface qui sépare des régions de décision.


Machine Learning avec des modèles à base d'arbres en Python