क्लस्टर साइज़िंग टिप्स

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

कॉन्फ़िगरेशन विकल्प

  • Spark में बहुत सी कॉन्फ़िगरेशन सेटिंग्स होती हैं
  • इन्हें जरूरत के अनुसार बदला जा सकता है
  • कॉन्फ़िगरेशन सेटिंग्स पढ़ना:
    spark.conf.get(<configuration name>)
    
  • कॉन्फ़िगरेशन सेटिंग्स लिखना
    spark.conf.set(<configuration name>)
    
PySpark के साथ डेटा क्लीनिंग

क्लस्टर प्रकार

Spark डिप्लॉयमेंट विकल्प:

  • सिंगल नोड
  • स्टैंडअलोन
  • मैनेज्ड
    • YARN
    • Mesos
    • Kubernetes
PySpark के साथ डेटा क्लीनिंग

ड्राइवर

  • टास्क असाइनमेंट
  • रिज़ल्ट कंसॉलिडेशन
  • साझा डेटा एक्सेस

टिप्स:

  • ड्राइवर नोड के पास वर्कर से दोगुनी मेमोरी होनी चाहिए
  • तेज़ लोकल स्टोरेज मददगार है
PySpark के साथ डेटा क्लीनिंग

वर्कर

  • वास्तविक टास्क चलाता है
  • आदर्श रूप से दिए गए टास्क का सारा कोड, डेटा और संसाधन हों

सिफारिशें:

  • अधिक वर्कर नोड, बड़े वर्कर्स से अक्सर बेहतर होते हैं
  • संतुलन खोजने के लिए टेस्ट करें
  • तेज़ लोकल स्टोरेज बेहद उपयोगी है
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...