Rezumat

Transformarea datelor cu Spark SQL în Databricks

Disha Mukherjee

Lead Data Engineer

Capitolul 1

Prezentare generală a spațiului de lucru Databricks

  • Încărcarea și inspectarea DataFrame-urilor
  • Modelarea datelor cu PySpark și Spark SQL
Transformarea datelor cu Spark SQL în Databricks

Capitolul 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Eliminarea valorilor nule, a duplicatelor și a înregistrărilor invalide
  • Agregare și îmbinare cu optimizare broadcast
Transformarea datelor cu Spark SQL în Databricks

Capitolul 3

DAG-ul pipeline-ului Lakeflow

  • Funcții de fereastră și interogări în flux
  • Pipeline-uri de producție cu Databricks Jobs și Lakeflow
Transformarea datelor cu Spark SQL în Databricks

Exersează într-un spațiu de lucru Databricks live

Tabel interactiv cu sortare și căutare

$$

$$

$$

  • Seturi de date tranzacționale și de retail online
  • Practică interactivă într-un spațiu de lucru Databricks live
Transformarea datelor cu Spark SQL în Databricks

Felicitări!

Transformarea datelor cu Spark SQL în Databricks

Preparing Video For Download...