Riepilogo

Trasformazione dei dati con Spark SQL in Databricks

Disha Mukherjee

Lead Data Engineer

Capitolo 1

Panoramica dello spazio di lavoro Databricks

  • Caricare e ispezionare DataFrame
  • Modellare i dati con PySpark e Spark SQL
Trasformazione dei dati con Spark SQL in Databricks

Capitolo 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Pulizia di null, duplicati e record non validi
  • Aggregazioni e join con ottimizzazione broadcast
Trasformazione dei dati con Spark SQL in Databricks

Capitolo 3

DAG della pipeline Lakeflow

  • Funzioni finestra e query in streaming
  • Pipeline di produzione con Databricks Jobs e Lakeflow
Trasformazione dei dati con Spark SQL in Databricks

Esercitazione in uno spazio di lavoro Databricks live

Tabella interattiva con ordinamento e ricerca

$$

$$

$$

  • Insiemi di dati retail transazionali e online
  • Esercitazione interattiva in uno spazio di lavoro Databricks live
Trasformazione dei dati con Spark SQL in Databricks

Congratulazioni!

Trasformazione dei dati con Spark SQL in Databricks

Preparing Video For Download...