Стандартизация

Предобработка данных для машинного обучения на Python

James Chapman

Curriculum Manager, DataCamp

Что такое стандартизация?

 

Стандартизация: преобразование непрерывных данных к нормальному распределению

  • Модели scikit-learn предполагают нормальное распределение данных
  • Ненормальные обучающие данные могут вносить смещение
  • В курсе рассматриваются логарифмическая нормализация и масштабирование признаков
  • Применяются к непрерывным числовым данным
Предобработка данных для машинного обучения на Python

Когда стандартизировать: линейные расстояния

  • Модель в линейном пространстве

 

Примеры:

  • k-ближайших соседей (kNN)
  • Линейная регрессия
  • Кластеризация K-Means

Пример kNN.

Предобработка данных для машинного обучения на Python

Когда стандартизировать: высокая дисперсия

  • Модель в линейном пространстве

 

Примеры:

  • k-ближайших соседей (kNN)
  • Линейная регрессия
  • Кластеризация K-Means

 

  • Признаки набора данных имеют высокую дисперсию

Пример kNN.

Предобработка данных для машинного обучения на Python

Когда стандартизировать: разные масштабы

 

  • Признаки имеют разные масштабы

 

Пример:

  • Прогнозирование цен на жильё по количеству спален и цене последней продажи

 

  • Предположения о линейности
Предобработка данных для машинного обучения на Python

Давайте потренируемся!

Предобработка данных для машинного обучения на Python

Preparing Video For Download...