Afronden

Gegevens transformeren met Spark SQL in Databricks

Disha Mukherjee

Lead Data Engineer

Hoofdstuk 1

Overzicht van de Databricks-werkruimte

  • DataFrames laden en inspecteren
  • Data vormgeven met PySpark en Spark SQL
Gegevens transformeren met Spark SQL in Databricks

Hoofdstuk 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Nulls, duplicaten en ongeldige records opschonen
  • Aggregaties en joins met broadcast-optimalisatie
Gegevens transformeren met Spark SQL in Databricks

Hoofdstuk 3

Lakeflow-pijplijn-DAG

  • Window-functies en streamingqueries
  • Productiepijplijnen met Databricks Jobs en Lakeflow
Gegevens transformeren met Spark SQL in Databricks

Oefenen in een live Databricks-werkruimte

Interactieve tabel met sorteren en zoeken

$$

$$

$$

  • Transactie- en online-retailgegevenssets
  • Interactief oefenen in een live Databricks-werkruimte
Gegevens transformeren met Spark SQL in Databricks

Gefeliciteerd!

Gegevens transformeren met Spark SQL in Databricks

Preparing Video For Download...