Sfaturi pentru dimensionarea clusterului

Curățarea datelor cu PySpark

Mike Metzger

Data Engineering Consultant

Opțiuni de configurare

  • Spark conține multe setări de configurare
  • Acestea pot fi modificate în funcție de nevoi
  • Citirea setărilor de configurare:
    spark.conf.get(<configuration name>)
    
  • Scrierea setărilor de configurare
    spark.conf.set(<configuration name>)
    
Curățarea datelor cu PySpark

Tipuri de clustere

Opțiuni de implementare Spark:

  • Nod unic
  • Standalone
  • Gestionat
    • YARN
    • Mesos
    • Kubernetes
Curățarea datelor cu PySpark

Driver

  • Atribuirea sarcinilor
  • Consolidarea rezultatelor
  • Acces partajat la date

Sfaturi:

  • Nodul driver ar trebui să aibă dublul memoriei unui worker
  • Stocarea locală rapidă este utilă
Curățarea datelor cu PySpark

Worker

  • Execută sarcinile efective
  • Ideal deține tot codul, datele și resursele necesare

Recomandări:

  • Mai mulți noduri worker este adesea mai bine decât noduri mai mari
  • Testați pentru a găsi echilibrul optim
  • Stocarea locală rapidă este extrem de utilă
Curățarea datelor cu PySpark

Să exersăm!

Curățarea datelor cu PySpark

Preparing Video For Download...