Pregătirea datelor pentru analiza clusterelor

Analiza clusterelor în Python

Shaumik Daityari

Business Analyst

De ce trebuie să pregătim datele pentru clustering?

  • Variabilele au unități incomparabile (dimensiuni în cm, preț în $)
  • Variabilele cu aceleași unități au scale și varianțe foarte diferite (cheltuieli pentru cereale, călătorii)
  • Datele brute pot introduce erori sistematice în clustering
  • Clusterele pot depinde excesiv de o singură variabilă
  • Soluție: normalizarea variabilelor individuale
Analiza clusterelor în Python

Normalizarea datelor

Normalizare: reajustarea datelor la o deviație standard de 1

x_new = x / std_dev(x)

from scipy.cluster.vq import whiten
data = [5, 1, 3, 3, 2, 3, 3, 8, 1, 2, 2, 3, 5]
scaled_data = whiten(data)
print(scaled_data)
[2.73, 0.55, 1.64, 1.64, 1.09, 1.64, 1.64, 4.36, 0.55, 1.09, 1.09, 1.64, 2.73]
Analiza clusterelor în Python

Ilustrare: normalizarea datelor

# Import plotting library
from matplotlib import pyplot as plt

# Initialize original, scaled data
plt.plot(data, 
         label="original")
plt.plot(scaled_data, 
         label="scaled")
# Show legend and display plot
plt.legend()
plt.show()

Analiza clusterelor în Python

Urmează: exerciții practice

Analiza clusterelor în Python

Preparing Video For Download...