Tips för klusters storlek

Datarensning med PySpark

Mike Metzger

Data Engineering Consultant

Konfigurationsalternativ

  • Spark innehåller många konfigurationsinställningar
  • De kan ändras efter behov
  • Läsa konfigurationsinställningar:
    spark.conf.get(<configuration name>)
    
  • Skriva konfigurationsinställningar
    spark.conf.set(<configuration name>)
    
Datarensning med PySpark

Klustertyper

Driftsättningsalternativ för Spark:

  • Enkel nod
  • Fristående
  • Hanterad
    • YARN
    • Mesos
    • Kubernetes
Datarensning med PySpark

Driver

  • Tilldelning av uppgifter
  • Konsolidering av resultat
  • Delad dataåtkomst

Tips:

  • Drivernoden bör ha dubbelt så mycket minne som worker-noden
  • Snabb lokal lagring är en fördel
Datarensning med PySpark

Worker

  • Kör de faktiska uppgifterna
  • Har helst all kod, data och resurser för en given uppgift

Rekommendationer:

  • Fler worker-noder är ofta bättre än större noder
  • Testa för att hitta rätt balans
  • Snabb lokal lagring är mycket värdefullt
Datarensning med PySpark

Nu kör vi en övning!

Datarensning med PySpark

Preparing Video For Download...