scikit-learn으로 배우는 지도 학습
George Boorman
Core Curriculum Manager, DataCamp
모델 성능은 데이터를 분할하는 방식에 따라 달라짐
미학습 데이터에 대한 모델의 일반화 능력을 대표하지 않음
해결책: 교차 검증!










5개 폴드 = 5-겹 교차 검증
10개 폴드 = 10-겹 교차 검증
k 폴드 = k-겹 교차 검증
폴드가 많을수록 = 계산 비용 증가
from sklearn.model_selection import cross_val_score, KFoldkf = KFold(n_splits=6, shuffle=True, random_state=42)reg = LinearRegression()cv_results = cross_val_score(reg, X, y, cv=kf)
print(cv_results)
[0.70262578, 0.7659624, 0.75188205, 0.76914482, 0.72551151, 0.73608277]
print(np.mean(cv_results), np.std(cv_results))
0.7418682216666667 0.023330243960652888
print(np.quantile(cv_results, [0.025, 0.975]))
array([0.7054865, 0.76874702])
scikit-learn으로 배우는 지도 학습