क्लस्टर विश्लेषण के लिए डेटा तैयारी

Python में क्लस्टर विश्लेषण

Shaumik Daityari

Business Analyst

क्लस्टरिंग के लिए डेटा क्यों तैयार करें?

  • वैरिएबल्स की इकाइयाँ तुलनीय नहीं हैं (उत्पाद के आयाम cm में, कीमत $ में)
  • समान इकाइयों वाले वैरिएबल्स के स्केल और variance बहुत अलग हैं (cereals, travel पर खर्च)
  • Raw डेटा क्लस्टरिंग में bias ला सकता है
  • क्लस्टर एक ही वैरिएबल पर अत्यधिक निर्भर हो सकते हैं
  • समाधान: व्यक्तिगत वैरिएबल्स का normalization
Python में क्लस्टर विश्लेषण

डेटा का normalization

Normalization: डेटा को rescale करने की प्रक्रिया ताकि standard deviation 1 हो जाए

x_new = x / std_dev(x)

from scipy.cluster.vq import whiten
data = [5, 1, 3, 3, 2, 3, 3, 8, 1, 2, 2, 3, 5]
scaled_data = whiten(data)
print(scaled_data)
[2.73, 0.55, 1.64, 1.64, 1.09, 1.64, 1.64, 4.36, 0.55, 1.09, 1.09, 1.64, 2.73]
Python में क्लस्टर विश्लेषण

चित्रण: डेटा का normalization

# Import plotting library
from matplotlib import pyplot as plt

# Initialize original, scaled data
plt.plot(data, 
         label="original")
plt.plot(scaled_data, 
         label="scaled")
# Show legend and display plot
plt.legend()
plt.show()

Python में क्लस्टर विश्लेषण

आगे: कुछ DIY अभ्यास

Python में क्लस्टर विश्लेषण

Preparing Video For Download...