Scalarea și transformarea datelor noi

Ingineria caracteristicilor pentru Machine Learning în Python

Robet O'Callaghan

Director of Data Science, Ordergroove

Reutilizarea scalerelor de antrenament

scaler = StandardScaler()

scaler.fit(train[['col']])

train['scaled_col'] = scaler.transform(train[['col']])

# FIT SOME MODEL
# ....

test = pd.read_csv('test_csv')

test['scaled_col'] = scaler.transform(test[['col']])

Ingineria caracteristicilor pentru Machine Learning în Python

Transformările de antrenament pentru reutilizare

train_mean = train[['col']].mean()
train_std = train[['col']].std()

cut_off = train_std * 3
train_lower = train_mean - cut_off
train_upper = train_mean + cut_off

# Subset train data

test = pd.read_csv('test_csv')

# Subset test data
test = test[(test[['col']] < train_upper) & 
              (test[['col']] > train_lower)]

Ingineria caracteristicilor pentru Machine Learning în Python

De ce se folosesc doar datele de antrenament?

 

Scurgere de date: Utilizarea datelor la care nu veți avea acces la evaluarea performanței modelului

Ingineria caracteristicilor pentru Machine Learning în Python

Evitați scurgerea de date!

Ingineria caracteristicilor pentru Machine Learning în Python

Preparing Video For Download...