Моделі регресії

Валідація моделей у Python

Kasey Jones

Data Scientist

Random forests у scikit-learn

from sklearn.ensemble import RandomForestRegressor
from sklearn.ensemble import RandomForestClassifier
rfr = RandomForestRegressor(random_state=1111)
rfc = RandomForestClassifier(random_state=1111)
Валідація моделей у Python

Дерева рішень починаються з усіх точок і зверху розгалужуються за різними розбиттями. Уявіть, що для кожної точки даних ви йдете різними шляхами гілками залежно від її ознак.

Валідація моделей у Python

Після побудови випадкового лісу підсумковий прогноз для кожної точки даних — це середнє результатів окремих дерев рішень.

Валідація моделей у Python

Параметри Random forest

n_estimators: кількість дерев у лісі

max_depth: максимальна глибина дерев

random_state: випадкове зерно

from sklearn.ensemble import RandomForestRegressor
rfr = RandomForestRegressor(n_estimators=50, max_depth=10)
rfr = RandomForestRegressor(random_state=1111)
rfr.n_estimators = 50
rfr.max_depth = 10
Валідація моделей у Python

Важливість ознак

Виведіть важливість кожного стовпця для моделі

for i, item in enumerate(rfr.feature_importances_):
    print("{0:s}: {1:.2f}".format(X.columns[i], item))
weight: 0.50
height: 0.39
left_handed: 0.72
union_preference: 0.05
eye_color: 0.03
Валідація моделей у Python

Почнімо

Валідація моделей у Python

Preparing Video For Download...