Типы кластеров и среды выполнения
Введение в Databricks Lakehouse
Gang Wang
Senior Data Scientist
Что такое кластер?
$$
Набор виртуальных машин
для выполнения вашего кода
Один узел
драйвера
координирует работу
Один или несколько узлов
воркеров
выполняют обработку
Кластеры читают данные из облачного хранилища
$$
$$
Универсальные кластеры
$$
Интерактивная
разработка и ad-hoc запросы
Общий
доступ для нескольких участников команды
Работают до
ручной
остановки
Как личный автомобиль — всегда доступен, но расходы идут даже на стоянке
$$
Кластеры для заданий
$$
Создаются
автоматически
при запуске задания
Выполняют
одну задачу
, затем завершают работу
Ручное управление не требуется
Оптимизированы по стоимости
для производственных нагрузок
$$
Какой тип выбрать?
$$
Типичная ошибка:
запуск производственных пайплайнов на универсальных кластерах
Databricks Runtime
$$
Версионированный программный стек
, работающий на каждом кластере
Включает Apache Spark, Delta Lake, Python, R, Scala
Версии
LTS
— долгосрочная поддержка, рекомендуются для продакшна
ML Runtime
добавляет предустановленные ML-библиотеки
$$
Итоги
$$
Универсальные кластеры
— интерактивные, общие, с ручным управлением
Кластеры для заданий
— автоматизированные, однозадачные, оптимизированные по стоимости
Databricks Runtime
— версионированный программный стек (используйте LTS для продакшна)
Подбирайте тип кластера под нагрузку, чтобы контролировать расходы
Давайте потренируемся!
Введение в Databricks Lakehouse
Preparing Video For Download...