중심화와 스케일링

scikit-learn으로 배우는 지도 학습

George Boorman

Core Curriculum Manager

왜 데이터를 확장해야 할까요?

print(music_df[["duration_ms", "loudness", "speechiness"]].describe())
         duration_ms     loudness       speechiness
count    1.000000e+03    1000.000000    1000.000000
mean     2.176493e+05    -8.284354      0.078642
std      1.137703e+05    5.065447       0.088291
min      -1.000000e+00   -38.718000     0.023400
25%      1.831070e+05    -9.658500      0.033700
50%      2.176493e+05    -7.033500      0.045000
75%      2.564468e+05    -5.034000      0.078642
max      1.617333e+06    -0.883000      0.710000
scikit-learn으로 배우는 지도 학습

왜 데이터를 확장해야 할까요?

  • 많은 모델이 거리의 어떤 형태를 사용해 정보를 얻음

  • 더 큰 스케일의 특성은 모델에 불균형적으로 영향을 미칠 수 있음

  • 예시: KNN은 예측을 할 때 명시적으로 거리를 사용

  • 우리는 특성들이 비슷한 스케일을 가지기를 원함

  • 정규화 또는 표준화(스케일링 및 중심화)

scikit-learn으로 배우는 지도 학습

데이터 확장 방법

  • 평균을 빼고 분산으로 나누기

    • 모든 특성은 0을 중심으로 배치되고 분산은 1임
    • 이를 표준화라고 함
  • 최소값을 빼고 범위로 나누기도 함

    • 최소 0, 최대 1
  • 데이터 범위를 -1에서 +1로 정규화할 수 있음

  • 자세한 내용은 scikit-learn 문서 참조

scikit-learn으로 배우는 지도 학습

scikit-learn에서의 스케일링

from sklearn.preprocessing import StandardScaler

X = music_df.drop("genre", axis=1).values y = music_df["genre"].values
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test)
print(np.mean(X), np.std(X)) print(np.mean(X_train_scaled), np.std(X_train_scaled))
19801.42536120538, 71343.52910125865
2.260817795600319e-17, 1.0
scikit-learn으로 배우는 지도 학습

파이프라인에서의 스케일링

steps = [('scaler', StandardScaler()),
         ('knn', KNeighborsClassifier(n_neighbors=6))]
pipeline = Pipeline(steps)

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=21)
knn_scaled = pipeline.fit(X_train, y_train)
y_pred = knn_scaled.predict(X_test)
print(knn_scaled.score(X_test, y_test))
0.81
scikit-learn으로 배우는 지도 학습

스케일링되지 않은 데이터를 사용한 성능 비교

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=21)
knn_unscaled = KNeighborsClassifier(n_neighbors=6).fit(X_train, y_train)
print(knn_unscaled.score(X_test, y_test))
0.53
scikit-learn으로 배우는 지도 학습

파이프라인에서의 교차 검증 및 스케일링

from sklearn.model_selection import GridSearchCV
steps = [('scaler', StandardScaler()),
         ('knn', KNeighborsClassifier())]
pipeline = Pipeline(steps)

parameters = {"knn__n_neighbors": np.arange(1, 50)}
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=21)
cv = GridSearchCV(pipeline, param_grid=parameters)
cv.fit(X_train, y_train)
y_pred = cv.predict(X_test)
scikit-learn으로 배우는 지도 학습

모델 매개변수 확인

print(cv.best_score_)
0.8199999999999999
print(cv.best_params_)
{'knn__n_neighbors': 12}
scikit-learn으로 배우는 지도 학습

연습해 봅시다!

scikit-learn으로 배우는 지도 학습

Preparing Video For Download...