Преобразование данных в Databricks

Концепции Databricks

Kevin Barlow

Data Practitioner

SQL для инженерии данных

SQL

  • Знаком администраторам баз данных (DBA)
  • Подходит для стандартных операций
  • Выполнение предопределённых UDF
-- Creating a new table in SQL

CREATE TABLE table_name
USING delta
AS (
  SELECT *
  FROM source_table
  WHERE date >= '2023-01-01'
)
Концепции Databricks

Другие языки для инженерии данных

Python, R, Scala

  • Знакомы разработчикам программного обеспечения
  • Стандартные и сложные преобразования
  • Использование и создание пользовательских функций
#Creating a new table in Pyspark

spark
  .read
  .table('source_table')
  .filter(col('date') >= '2023-01-01')
  .write
  .saveAsTable('table_name')
Концепции Databricks

Распространённые преобразования

Работа со схемой

  • Добавление и удаление столбцов
  • Переопределение столбцов

#Pyspark

df
  .withColumn(col('newCol'), ...)
  .drop(col('oldCol'))

Фильтрация

  • Сужение DataFrame до подмножества данных
  • Применение нескольких условий

#Pyspark

df
  .filter(col('date') >= target_date)
  .filter(col('id') IS NOT NULL)
Концепции Databricks

Распространённые преобразования (продолжение)

Вложенные данные

  • Массивы или данные типа Struct
  • Развёртывание и свёртывание
df
  .explode(col('arrayCol')) #wide to long
  .flatten(col('items')) #long to wide

Агрегация

  • Группировка данных по столбцам
  • Вычисление сводных показателей
df
  .groupBy(col('region'))
  .agg(sum(col('sales')))
Концепции Databricks

Auto Loader

Auto Loader обрабатывает новые файлы по мере их поступления в озеро данных.

  • Инкрементная обработка
  • Эффективная обработка
  • Автоматический режим
spark.readStream
  .format("cloudFiles")
  .option("cloudFiles.format", "json")
  .load(file_path)

Схема Auto Loader

1 https://www.databricks.com/blog/2020/02/24/introducing-databricks-ingest-easy-data-ingestion-into-delta-lake.html
Концепции Databricks

Structured Streaming

Потоковый конвейер

spark.readStream
    .format("kafka")
    .option("subscribe", "<topic>")
    .load()
    .join(table_df, 
      on="<id>", how="left")
    .writeStream
    .format("kafka")
    .option("topic", "<topic>")
    .start()
Концепции Databricks

Давайте потренируемся!

Концепции Databricks

Preparing Video For Download...