Chuẩn hóa và biến đổi dữ liệu mới

Feature Engineering cho Machine Learning bằng Python

Robet O'Callaghan

Director of Data Science, Ordergroove

Tái sử dụng scaler từ tập huấn luyện

scaler = StandardScaler()

scaler.fit(train[['col']])

train['scaled_col'] = scaler.transform(train[['col']])

# FIT SOME MODEL
# ....

test = pd.read_csv('test_csv')

test['scaled_col'] = scaler.transform(test[['col']])

Feature Engineering cho Machine Learning bằng Python

Biến đổi trên tập huấn luyện để tái sử dụng

train_mean = train[['col']].mean()
train_std = train[['col']].std()

cut_off = train_std * 3
train_lower = train_mean - cut_off
train_upper = train_mean + cut_off

# Subset train data

test = pd.read_csv('test_csv')

# Subset test data
test = test[(test[['col']] < train_upper) & 
              (test[['col']] > train_lower)]

Feature Engineering cho Machine Learning bằng Python

Vì sao chỉ dùng dữ liệu huấn luyện?

 

Rò rỉ dữ liệu: Sử dụng dữ liệu mà bạn sẽ không có khi đánh giá hiệu năng mô hình

Feature Engineering cho Machine Learning bằng Python

Tránh rò rỉ dữ liệu!

Feature Engineering cho Machine Learning bằng Python

Preparing Video For Download...