Sammanfattning

Datatransformation med Spark SQL i Databricks

Disha Mukherjee

Lead Data Engineer

Kapitel 1

Översikt över Databricks-arbetsytan

  • Läsa in och granska DataFrames
  • Forma data med PySpark och Spark SQL
Datatransformation med Spark SQL i Databricks

Kapitel 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Rensa null-värden, dubbletter och ogiltiga poster
  • Aggregera och joina med broadcast-optimering
Datatransformation med Spark SQL i Databricks

Kapitel 3

DAG för Lakeflow-pipeline

  • Fönsterfunktioner och strömningsfrågor
  • Produktionspipelines med Databricks Jobs och Lakeflow
Datatransformation med Spark SQL i Databricks

Öva i en live-arbetsyta i Databricks

Interaktiv tabell med sortering och sökning

$$

$$

$$

  • Transaktions- och detaljhandelsdata
  • Interaktiv träning i en live-arbetsyta i Databricks
Datatransformation med Spark SQL i Databricks

Grattis!

Datatransformation med Spark SQL i Databricks

Preparing Video For Download...