Кластерный анализ: выбор оптимального числа кластеров

Практика вопросов интервью по машинному обучению на Python

Lisa Stuart

Data Scientist

Методы выбора оптимального k

  • Метод силуэта
  • Метод локтя
Практика вопросов интервью по машинному обучению на Python

Коэффициент силуэта

  • Состоит из 2 показателей
    • Среднее расстояние от каждого наблюдения до остальных:
      • в том же кластере
      • в ближайшем кластере
Практика вопросов интервью по машинному обучению на Python

Значения коэффициента силуэта

  • От -1 до 1
    • 1
      • близко к объектам в том же кластере
      • далеко от объектов в других кластерах
    • -1
      • далеко от объектов в том же кластере
      • близко к объектам в других кластерах
    • 0
      • означает перекрывающиеся кластеры
Практика вопросов интервью по машинному обучению на Python

Оценка силуэта

График оценки силуэта

1 https://scikit-learn.org/stable/auto_examples/cluster/plot_kmeans_silhouette_analysis.html
Практика вопросов интервью по машинному обучению на Python

Метод локтя

График метода локтя

1 https://www.datanovia.com/en/lessons/determining-the-optimal-number-of-clusters-3-must-know-methods/
Практика вопросов интервью по машинному обучению на Python

Функции для выбора оптимального k

Функция/метод возвращает
sklearn.cluster.KMeans алгоритм кластеризации K-средних
sklearn.metrics.silhouette_score оценку от -1 до 1 как меру стабильности кластеров
kmeans.inertia_ сумму квадратов расстояний от наблюдений до ближайшего центра кластера
range(start, stop) список значений от start до stop (не включая stop)
list.append(kmeans.inertia_) добавляет значение инерции в список
Практика вопросов интервью по машинному обучению на Python

Давайте потренируемся!

Практика вопросов интервью по машинному обучению на Python

Preparing Video For Download...