Советы по размеру кластера

Очистка данных с помощью PySpark

Mike Metzger

Data Engineering Consultant

Параметры конфигурации

  • Spark содержит множество настроек конфигурации
  • Их можно изменять под конкретные задачи
  • Чтение настроек конфигурации:
    spark.conf.get(<configuration name>)
    
  • Запись настроек конфигурации
    spark.conf.set(<configuration name>)
    
Очистка данных с помощью PySpark

Типы кластеров

Варианты развёртывания Spark:

  • Одиночный узел
  • Автономный
  • Управляемый
    • YARN
    • Mesos
    • Kubernetes
Очистка данных с помощью PySpark

Драйвер

  • Назначение задач
  • Консолидация результатов
  • Общий доступ к данным

Рекомендации:

  • Память драйвера должна быть вдвое больше памяти воркера
  • Быстрое локальное хранилище будет полезно
Очистка данных с помощью PySpark

Воркер

  • Выполняет фактические задачи
  • В идеале содержит весь код, данные и ресурсы для задачи

Рекомендации:

  • Больше воркер-узлов зачастую лучше, чем более мощные воркеры
  • Проводите тесты для поиска оптимального баланса
  • Быстрое локальное хранилище крайне полезно
Очистка данных с помощью PySpark

Давайте потренируемся!

Очистка данных с помощью PySpark

Preparing Video For Download...