학습·테스트·검증 데이터셋 만들기

Python에서의 모델 검증

Kasey Jones

Data Scientist

전통적 학습/테스트 분할

  • 본 데이터(학습에 사용)
  • 미본 데이터(학습에 미사용)

데이터 분할은 가용 데이터의 일부로 학습을, 더 작은 일부로 테스트를 만드는 것입니다.

Python에서의 모델 검증

데이터셋 정의와 비율

데이터셋 정의
Train 모델 학습에 사용하는 데이터 샘플
Test (holdout sample) 모델 성능을 평가하는 데이터 샘플

비율 예시

  • 80:20
  • 90:10 (데이터가 적을 때)
  • 70:30 (계산 비용이 클 때)
Python에서의 모델 검증

X와 y 데이터셋

import pandas as pd

tic_tac_toe = pd.read_csv("tic-tac-toe.csv")
X = pd.get_dummies(tic_tac_toe.iloc[:,0:9])
y = tic_tac_toe.iloc[:, 9]

더미 변수 관련 Python 강좌:

Python에서의 모델 검증

홀드아웃 샘플 만들기

X_train, X_test, y_train, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)

매개변수:

  • test_size
  • train_size
  • random_state
Python에서의 모델 검증

사전 시험용 데이터셋?

서로 다른 모델 파라미터를 시험할 때는?

  • 100 대 1000 트리
Python에서의 모델 검증

모델 하이퍼파라미터를 시험하려면 데이터를 세 부분으로 나눕니다. 학습, 검증, 테스트.

Python에서의 모델 검증

학습·검증·테스트 계속

X_temp, X_test, y_temp, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)
X_train, X_val, y_train, y_val =\
    train_test_split(X_temp, y_temp, test_size=0.25, random_state=11111)
Python에서의 모델 검증

이제 홀드아웃

Python에서의 모델 검증

Preparing Video For Download...