Regressionsmodeller

Modellvalidering i Python

Kasey Jones

Data Scientist

Slumpskogar i scikit-learn

from sklearn.ensemble import RandomForestRegressor
from sklearn.ensemble import RandomForestClassifier
rfr = RandomForestRegressor(random_state=1111)
rfc = RandomForestClassifier(random_state=1111)
Modellvalidering i Python

Beslutsträd börjar med alla datapunkter och grenar sig uppifrån baserat på olika uppdelningar. Följ de olika vägarna genom trädets grenar för varje datapunkt, utifrån datats egenskaper.

Modellvalidering i Python

När en slumpskog är klar beräknas medelvärdet av de enskilda beslutsträdens resultat för varje datapunkt, vilket ger den slutliga prediktionen.

Modellvalidering i Python

Parametrar för slumpskog

n_estimators: antalet träd i skogen

max_depth: trädets maximala djup

random_state: slumpmässigt frö

from sklearn.ensemble import RandomForestRegressor
rfr = RandomForestRegressor(n_estimators=50, max_depth=10)
rfr = RandomForestRegressor(random_state=1111)
rfr.n_estimators = 50
rfr.max_depth = 10
Modellvalidering i Python

Särdragsvikt

Skriv ut hur viktig varje kolumn är för modellen

for i, item in enumerate(rfr.feature_importances_):
    print("{0:s}: {1:.2f}".format(X.columns[i], item))
weight: 0.50
height: 0.39
left_handed: 0.72
union_preference: 0.05
eye_color: 0.03
Modellvalidering i Python

Nu kör vi en övning!

Modellvalidering i Python

Preparing Video For Download...