Datatransformationer i Databricks

Databricks – grundläggande koncept

Kevin Barlow

Data Practitioner

SQL för datateknik

SQL

  • Bekant för databasadministratörer (DBA:er)
  • Bra för standardmanipulationer
  • Kör fördefinierade UDF:er
-- Creating a new table in SQL

CREATE TABLE table_name
USING delta
AS (
  SELECT *
  FROM source_table
  WHERE date >= '2023-01-01'
)
Databricks – grundläggande koncept

Andra språk för datateknik

Python, R, Scala

  • Bekant för mjukvaruutvecklare
  • Standard- och komplexa transformationer
  • Använd och definiera egna funktioner
#Creating a new table in Pyspark

spark
  .read
  .table('source_table')
  .filter(col('date') >= '2023-01-01')
  .write
  .saveAsTable('table_name')
Databricks – grundläggande koncept

Vanliga transformationer

Schemamanipulation

  • Lägg till och ta bort kolumner
  • Omdefiniera kolumner

#Pyspark

df
  .withColumn(col('newCol'), ...)
  .drop(col('oldCol'))

Filtrering

  • Reducera DataFrame till en delmängd data
  • Ange flera villkor

#Pyspark

df
  .filter(col('date') >= target_date)
  .filter(col('id') IS NOT NULL)
Databricks – grundläggande koncept

Vanliga transformationer (fortsättning)

Nästlad data

  • Array- eller Struct-data
  • Expandera eller komprimera
df
  .explode(col('arrayCol')) #wide to long
  .flatten(col('items')) #long to wide

Aggregering

  • Gruppera data baserat på kolumner
  • Beräkna datasammanfattningar
df
  .groupBy(col('region'))
  .agg(sum(col('sales')))
Databricks – grundläggande koncept

Auto Loader

Auto Loader bearbetar nya datafiler när de landar i ett datasjö.

  • Inkrementell bearbetning
  • Effektiv bearbetning
  • Automatisk
spark.readStream
  .format("cloudFiles")
  .option("cloudFiles.format", "json")
  .load(file_path)

Diagram över Auto Loader

1 https://www.databricks.com/blog/2020/02/24/introducing-databricks-ingest-easy-data-ingestion-into-delta-lake.html
Databricks – grundläggande koncept

Structured Streaming

Strömmande pipeline

spark.readStream
    .format("kafka")
    .option("subscribe", "<topic>")
    .load()
    .join(table_df, 
      on="<id>", how="left")
    .writeStream
    .format("kafka")
    .option("topic", "<topic>")
    .start()
Databricks – grundläggande koncept

Nu kör vi en övning!

Databricks – grundläggande koncept

Preparing Video For Download...