새 데이터의 스케일링과 변환

Python으로 배우는 Machine Learning 특성 공학

Robet O'Callaghan

Director of Data Science, Ordergroove

훈련 스케일러 재사용

scaler = StandardScaler()

scaler.fit(train[['col']])

train['scaled_col'] = scaler.transform(train[['col']])

# FIT SOME MODEL
# ....

test = pd.read_csv('test_csv')

test['scaled_col'] = scaler.transform(test[['col']])

Python으로 배우는 Machine Learning 특성 공학

재사용을 위한 훈련 변환

train_mean = train[['col']].mean()
train_std = train[['col']].std()

cut_off = train_std * 3
train_lower = train_mean - cut_off
train_upper = train_mean + cut_off

# Subset train data

test = pd.read_csv('test_csv')

# Subset test data
test = test[(test[['col']] < train_upper) & 
              (test[['col']] > train_lower)]

Python으로 배우는 Machine Learning 특성 공학

왜 훈련 데이터만 사용할까요?

 

데이터 누수: 모델 성능을 평가할 때 접근할 수 없는 데이터를 사용하는 것

Python으로 배우는 Machine Learning 특성 공학

데이터 누수를 피하세요!

Python으로 배우는 Machine Learning 특성 공학

Preparing Video For Download...