Shrnutí

Transformace dat pomocí Spark SQL v Databricks

Disha Mukherjee

Lead Data Engineer

Kapitola 1

Přehled pracovního prostoru Databricks

  • Načítání a prohlížení DataFramů
  • Tvarování dat s PySparkem a Spark SQL
Transformace dat pomocí Spark SQL v Databricks

Kapitola 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Čištění nulových hodnot, duplikátů a neplatných záznamů
  • Agregace a joiny s broadcast optimalizací
Transformace dat pomocí Spark SQL v Databricks

Kapitola 3

DAG pipeline Lakeflow

  • Okenní funkce a streamovací dotazy
  • Produkční pipeline s Databricks Jobs a Lakeflow
Transformace dat pomocí Spark SQL v Databricks

Cvičení v živém pracovním prostoru Databricks

Interaktivní tabulka s řazením a vyhledáváním

$$

$$

$$

  • Transakční a online retailové datasety
  • Interaktivní cvičení v živém pracovním prostoru Databricks
Transformace dat pomocí Spark SQL v Databricks

Gratulujeme!

Transformace dat pomocí Spark SQL v Databricks

Preparing Video For Download...