เคล็ดลับการกำหนดขนาด Cluster

การทำความสะอาดข้อมูลด้วย PySpark

Mike Metzger

Data Engineering Consultant

ตัวเลือกการตั้งค่า

  • Spark มีการตั้งค่าคอนฟิกมากมาย
  • ปรับแต่งได้ตามความต้องการ
  • อ่านค่าคอนฟิก:
    spark.conf.get(<configuration name>)
    
  • เขียนค่าคอนฟิก
    spark.conf.set(<configuration name>)
    
การทำความสะอาดข้อมูลด้วย PySpark

ประเภทของ Cluster

รูปแบบการ Deploy Spark:

  • Single node
  • Standalone
  • Managed
    • YARN
    • Mesos
    • Kubernetes
การทำความสะอาดข้อมูลด้วย PySpark

Driver

  • มอบหมาย Task
  • รวบรวมผลลัพธ์
  • เข้าถึงข้อมูลที่ใช้ร่วมกัน

เคล็ดลับ:

  • Driver node ควรมี Memory เป็น 2 เท่าของ Worker
  • Storage ท้องถิ่นที่เร็วช่วยได้มาก
การทำความสะอาดข้อมูลด้วย PySpark

Worker

  • รัน Task จริง
  • ควรมีโค้ด ข้อมูล และทรัพยากรครบสำหรับแต่ละ Task

คำแนะนำ:

  • เพิ่มจำนวน Worker node มักดีกว่าขยายขนาด Worker
  • ทดสอบเพื่อหาสมดุลที่เหมาะสม
  • Storage ท้องถิ่นที่เร็วมีประโยชน์มาก
การทำความสะอาดข้อมูลด้วย PySpark

มาฝึกกันเถอะ!

การทำความสะอาดข้อมูลด้วย PySpark

Preparing Video For Download...