Tipy pro velikost clusteru

Cleaning Data with PySpark

Mike Metzger

Data Engineering Consultant

Možnosti konfigurace

  • Spark obsahuje mnoho konfiguračních nastavení
  • Lze je upravit podle potřeby
  • Čtení konfiguračních nastavení:
    spark.conf.get(<configuration name>)
    
  • Zápis konfiguračních nastavení
    spark.conf.set(<configuration name>)
    
Cleaning Data with PySpark

Typy clusterů

Možnosti nasazení Sparku:

  • Jeden uzel
  • Samostatný
  • Spravovaný
    • YARN
    • Mesos
    • Kubernetes
Cleaning Data with PySpark

Driver

  • Přidělování úloh
  • Konsolidace výsledků
  • Sdílený přístup k datům

Tipy:

  • Uzel driver by měl mít dvojnásobnou paměť oproti worker uzlu
  • Rychlé místní úložiště je výhodou
Cleaning Data with PySpark

Worker

  • Spouští skutečné úlohy
  • Ideálně obsahuje veškerý kód, data a zdroje pro danou úlohu

Doporučení:

  • Více worker uzlů je často lepší než větší uzly
  • Testováním najděte správnou rovnováhu
  • Rychlé místní úložiště je velmi užitečné
Cleaning Data with PySpark

Pojďme si to procvičit!

Cleaning Data with PySpark

Preparing Video For Download...