Снижение размерности

Предобработка данных для машинного обучения на Python

James Chapman

Curriculum Manager, DataCamp

Снижение размерности и PCA

  • Метод обучения без учителя
  • Объединяет/разлагает пространство признаков
  • Извлечение признаков — здесь используется для сокращения пространства признаков
  • Метод главных компонент
  • Линейное преобразование в пространство некоррелированных признаков
  • Максимально захватывает дисперсию в каждой компоненте
Предобработка данных для машинного обучения на Python

PCA в scikit-learn

from sklearn.decomposition import PCA
pca = PCA()
df_pca = pca.fit_transform(df)

print(df_pca)
[88.4583, 18.7764, -2.2379, ..., 0.0954, 0.0361, -0.0034],
[93.4564, 18.6709, -1.7887, ..., -0.0509, 0.1331, 0.0119],
[-186.9433, -0.2133, -5.6307, ..., 0.0332, 0.0271, 0.0055]
print(pca.explained_variance_ratio_)
[0.9981, 0.0017, 0.0001, 0.0001, ...]
Предобработка данных для машинного обучения на Python

Ограничения PCA

  • Компоненты сложно интерпретировать
  • Завершение этапа предобработки
Предобработка данных для машинного обучения на Python

Давайте потренируемся!

Предобработка данных для машинного обучения на Python

Preparing Video For Download...