Подведём итоги

Преобразование данных с помощью Spark SQL в Databricks

Disha Mukherjee

Lead Data Engineer

Глава 1

Обзор рабочей области Databricks

  • Загрузка и изучение DataFrame
  • Преобразование данных с помощью PySpark и Spark SQL
Преобразование данных с помощью Spark SQL в Databricks

Глава 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Очистка от пропусков, дубликатов и некорректных записей
  • Агрегация и объединение с оптимизацией через broadcast
Преобразование данных с помощью Spark SQL в Databricks

Глава 3

DAG конвейера Lakeflow

  • Оконные функции и потоковые запросы
  • Производственные конвейеры с Databricks Jobs и Lakeflow
Преобразование данных с помощью Spark SQL в Databricks

Практика в реальной рабочей области Databricks

Интерактивная таблица с сортировкой и поиском

$$

$$

$$

  • Наборы данных транзакционной и онлайн-розничной торговли
  • Практика в реальной рабочей области Databricks
Преобразование данных с помощью Spark SQL в Databricks

Поздравляем!

Преобразование данных с помощью Spark SQL в Databricks

Preparing Video For Download...