Поради щодо розміру кластера

Очищення даних у PySpark

Mike Metzger

Data Engineering Consultant

Параметри конфігурації

  • У Spark багато параметрів конфігурації
  • Їх можна змінювати під потреби
  • Читання параметрів конфігурації:
    spark.conf.get(<configuration name>)
    
  • Запис параметрів конфігурації
    spark.conf.set(<configuration name>)
    
Очищення даних у PySpark

Типи кластерів

Варіанти розгортання Spark:

  • Один вузол
  • Standalone
  • Керовані сервіси
    • YARN
    • Mesos
    • Kubernetes
Очищення даних у PySpark

Driver

  • Призначення завдань
  • Консолідація результатів
  • Спільний доступ до даних

Поради:

  • Вузол драйвера має мати вдвічі більше пам'яті, ніж worker
  • Швидке локальне сховище корисне
Очищення даних у PySpark

Worker

  • Виконує реальні завдання
  • Бажано мати весь код, дані й ресурси для задачі

Рекомендації:

  • Зазвичай більше worker-вузлів краще, ніж більші вузли
  • Тестуйте, щоб знайти баланс
  • Дуже корисне швидке локальне сховище
Очищення даних у PySpark

Давайте потренуємось!

Очищення даних у PySpark

Preparing Video For Download...