ข้อจำกัดของ k-means clustering

การวิเคราะห์กลุ่มข้อมูลใน Python

Shaumik Daityari

Business Analyst

ข้อจำกัดของ k-means clustering

  • จะเลือก _K_ (จำนวนคลัสเตอร์) ที่เหมาะสมได้อย่างไร?
  • ผลกระทบของ seed
  • มีความเอนเอียงไปยังคลัสเตอร์ขนาดเท่ากัน
การวิเคราะห์กลุ่มข้อมูลใน Python

ผลกระทบของ seed

กำหนด random seed

from numpy import random
random.seed(12)

Seed: np.array(1000, 2000)

ขนาดคลัสเตอร์: 29, 29, 43, 47, 52

 

Seed: np.array(1,2,3)

ขนาดคลัสเตอร์: 26, 31, 40, 50, 53

การวิเคราะห์กลุ่มข้อมูลใน Python

ผลกระทบของ seed: กราฟ

Seed: np.array(1000, 2000)

Seed: np.array(1,2,3)

การวิเคราะห์กลุ่มข้อมูลใน Python

คลัสเตอร์ขนาดสม่ำเสมอใน k-means

การวิเคราะห์กลุ่มข้อมูลใน Python

คลัสเตอร์ขนาดสม่ำเสมอใน k-means: การเปรียบเทียบ

K-means clustering ด้วย 3 คลัสเตอร์

Hierarchical clustering ด้วย 3 คลัสเตอร์

การวิเคราะห์กลุ่มข้อมูลใน Python

บทสรุป

  • แต่ละเทคนิคมีข้อดีและข้อเสียต่างกัน
  • พิจารณาขนาดและรูปแบบของข้อมูลก่อนเลือกอัลกอริทึม
  • การทำ clustering เป็นขั้นตอนเชิงสำรวจของการวิเคราะห์
การวิเคราะห์กลุ่มข้อมูลใน Python

ถัดไป: แบบฝึกหัด

การวิเคราะห์กลุ่มข้อมูลใน Python

Preparing Video For Download...