데이터 전처리

scikit-learn으로 배우는 지도 학습

George Boorman

Core Curriculum Manager, DataCamp

scikit-learn 요구 사항

  • 수치형 데이터
  • 결측값 없음
  • 실제 데이터 사용:
    • 이런 경우는 거의 없음
    • 우리는 종종 먼저 데이터를 전처리해야 함
scikit-learn으로 배우는 지도 학습

범주형 특성 다루기

  • scikit-learn은 기본적으로 범주형 특성을 허용하지 않음

  • 범주형 특성을 숫자 값으로 변환해야 함

  • 더미 변수라고 하는 이진 특성으로 변환

    • 0: 관찰값은 해당 범주가 아님(NOT)

    • 1: 관찰값은 해당 범주에 속함

scikit-learn으로 배우는 지도 학습

더미 변수

list of eleven genres including Electronic, Hip-Hop, and Rock

scikit-learn으로 배우는 지도 학습

더미 변수

Grid with genre values and column names and zeroes and ones as values, where 1 means the song is that genre, and 0 means it isn’t

scikit-learn으로 배우는 지도 학습

더미 변수

Grid of ones and zeroes without a column for Rock genre

scikit-learn으로 배우는 지도 학습

Python에서 범주형 특성 다루기

  • scikit-learn: OneHotEncoder()

  • pandas: get_dummies()

scikit-learn으로 배우는 지도 학습

음악 데이터세트

  • popularity: 타깃 변수
  • genre: 범주형 특성
print(music.info())
     popularity    acousticness    danceability    ...    tempo         valence    genre
0    41.0          0.6440          0.823           ...    102.619000    0.649      Jazz
1    62.0          0.0855          0.686           ...    173.915000    0.636      Rap
2    42.0          0.2390          0.669           ...    145.061000    0.494      Electronic
3    64.0          0.0125          0.522           ...    120.406497    0.595      Rock
4    60.0          0.1210          0.780           ...    96.056000     0.312      Rap
scikit-learn으로 배우는 지도 학습

범주형 특성이 포함된 EDA

Box plot showing popularity for each genre

scikit-learn으로 배우는 지도 학습

더미 변수 인코딩

import pandas as pd

music_df = pd.read_csv('music.csv')
music_dummies = pd.get_dummies(music_df["genre"], drop_first=True)
print(music_dummies.head())
     Anime    Blues    Classical    Country    Electronic    Hip-Hop    Jazz    Rap    Rock
0    0        0        0            0          0             0          1       0      0
1    0        0        0            0          0             0          0       1      0
2    0        0        0            0          1             0          0       0      0
3    0        0        0            0          0             0          0       0      1
4    0        0        0            0          0             0          0       1      0
music_dummies = pd.concat([music_df, music_dummies], axis=1)

music_dummies = music_dummies.drop("genre", axis=1)
scikit-learn으로 배우는 지도 학습

더미 변수 인코딩

music_dummies = pd.get_dummies(music_df, drop_first=True)

print(music_dummies.columns)
Index(['popularity', 'acousticness', 'danceability', 'duration_ms', 'energy',
       'instrumentalness', 'liveness', 'loudness', 'speechiness', 'tempo',
       'valence', 'genre_Anime', 'genre_Blues', 'genre_Classical',
       'genre_Country', 'genre_Electronic', 'genre_Hip-Hop', 'genre_Jazz',
       'genre_Rap', 'genre_Rock'],
      dtype='object')
scikit-learn으로 배우는 지도 학습

더미 변수를 사용한 선형 회귀

from sklearn.model_selection import cross_val_score, KFold
from sklearn.linear_model import LinearRegression
X = music_dummies.drop("popularity", axis=1).values
y = music_dummies["popularity"].values
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, 
                                                    random_state=42)

kf = KFold(n_splits=5, shuffle=True, random_state=42)
linreg = LinearRegression()
linreg_cv = cross_val_score(linreg, X_train, y_train, cv=kf, scoring="neg_mean_squared_error")
print(np.sqrt(-linreg_cv))
[8.15792932, 8.63117538, 7.52275279, 8.6205778, 7.91329988]
scikit-learn으로 배우는 지도 학습

연습해 봅시다!

scikit-learn으로 배우는 지도 학습

Preparing Video For Download...