Подводим итоги

Введение в Databricks Lakehouse

Gang Wang

Senior Data Scientist

Сценарий

$$

  • Вы — дата-инженер, приступающий к новому проекту в розничной компании
  • Цель: настроить вычисления, проверить пайплайн данных, оценить управление и подготовиться к развёртыванию

$$

recraft: half: Дата-инженер за современным рабочим столом с ноутбуком, на экране которого отображается интерфейс в стиле Databricks, а на доске за ним — схемы пайплайнов, что символизирует вход в новый проект

Введение в Databricks Lakehouse

Шаг 1: выбор вычислительных ресурсов

$$

  • Пайплайн запускается каждую ночь по расписанию
  • Интерактивная разработка не нужна
  • Оптимальный выбор — кластер для заданий с LTS-средой выполнения
  • Настройте автомасштабирование (2–6 воркеров) для переменного объёма данных

$$

Универсальный Кластер для заданий
Режим Интерактивный Автоматизированный
Управление Ручное Автозавершение
Стоимость Выше (простой) Оптимизированная
Введение в Databricks Lakehouse

Шаг 2: проверка медальонного пайплайна

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: необработанные данные, максимальное число строк
  • Silver: очищенные, без нулевых значений и дубликатов
  • Gold: агрегированные для бизнес-отчётности
  • Число строк уменьшается по мере роста качества
Введение в Databricks Lakehouse

Шаг 3: проверка управления данными

$$

  • Откройте Unity Catalog и изучите таблицу gold_daily_revenue
  • Проследите линейность данных вверх по цепочке, чтобы убедиться, что источник — silver_sales
  • Проверьте права доступа — только команда аналитиков имеет SELECT на gold
  • Убедитесь, что Delta Sharing настроен для внешнего партнёра

$$

recraft: half: Лупа над графом линейности данных с соединёнными узлами таблиц и галочками, символизирующая проверку управления данными

Введение в Databricks Lakehouse

Шаг 4: подготовка к развёртыванию

$$

  • Изучите Asset Bundle databricks.yml
  • Убедитесь, что ночное задание определено как ресурс
  • Проверьте, что производственная цель указывает на правильный путь в рабочем пространстве
  • Перед развёртыванием выполните bundle validate

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Введение в Databricks Lakehouse

Итоги

$$

  • Вычисления: подбирайте тип кластера под задачу (кластер для заданий при автоматизации)
  • Данные: убедитесь, что медальонные слои работают корректно
  • Управление: проследите линейность, проверьте доступ и обмен данными
  • Развёртывание: проверьте Asset Bundle, валидируйте, разверните
Введение в Databricks Lakehouse

Давайте потренируемся!

Введение в Databricks Lakehouse

Preparing Video For Download...