Стандартизация данных и моделирование

Предобработка данных для машинного обучения на Python

James Chapman

Curriculum Manager, DataCamp

Метод k ближайших соседей

  • Утечка данных: для обучения модели используются данные не из обучающей выборки
from sklearn.model_selection import train_test_split
from sklearn.neighbors import KNeighborsClassifier

X_train, X_test, y_train, y_test = train_test_split(X, y, stratify=y, random_state=42)
knn = KNeighborsClassifier() scaler = StandardScaler() X_train_scaled = scaler.fit_transform(X_train) X_test_scaled = scaler.transform(X_test)
knn.fit(X_train_scaled, y_train)
knn.score(X_test_scaled, y_test)
Предобработка данных для машинного обучения на Python

Давайте потренируемся!

Предобработка данных для машинного обучения на Python

Preparing Video For Download...