Wskazówki dotyczące rozmiaru klastra

Czyszczenie danych w PySpark

Mike Metzger

Data Engineering Consultant

Opcje konfiguracji

  • Spark zawiera wiele ustawień konfiguracyjnych
  • Można je dostosować do potrzeb
  • Odczyt ustawień konfiguracyjnych:
    spark.conf.get(<configuration name>)
    
  • Zapis ustawień konfiguracyjnych
    spark.conf.set(<configuration name>)
    
Czyszczenie danych w PySpark

Typy klastrów

Opcje wdrożenia Spark:

  • Węzeł pojedynczy
  • Autonomiczny
  • Zarządzany
    • YARN
    • Mesos
    • Kubernetes
Czyszczenie danych w PySpark

Sterownik

  • Przydzielanie zadań
  • Konsolidacja wyników
  • Dostęp do współdzielonych danych

Wskazówki:

  • Węzeł sterownika powinien mieć dwukrotnie więcej pamięci niż węzeł roboczy
  • Szybka pamięć lokalna jest pomocna
Czyszczenie danych w PySpark

Węzeł roboczy

  • Wykonuje rzeczywiste zadania
  • Idealnie posiada cały kod, dane i zasoby dla danego zadania

Zalecenia:

  • Więcej węzłów roboczych jest często lepsze niż większe węzły
  • Należy testować, aby znaleźć odpowiednią równowagę
  • Szybka pamięć lokalna jest bardzo przydatna
Czyszczenie danych w PySpark

Czas na ćwiczenia!

Czyszczenie danych w PySpark

Preparing Video For Download...