Podsumowanie

Data Transformation with Spark SQL in Databricks

Disha Mukherjee

Lead Data Engineer

Rozdział 1

Przegląd obszaru roboczego Databricks

  • Wczytywanie i przeglądanie DataFrames
  • Przekształcanie danych za pomocą PySpark i Spark SQL
Data Transformation with Spark SQL in Databricks

Rozdział 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Usuwanie wartości null, duplikatów i błędnych rekordów
  • Agregowanie i łączenie danych z optymalizacją broadcast
Data Transformation with Spark SQL in Databricks

Rozdział 3

DAG potoku Lakeflow

  • Funkcje okna i zapytania strumieniowe
  • Potoki produkcyjne z Databricks Jobs i Lakeflow
Data Transformation with Spark SQL in Databricks

Ćwicz w środowisku Databricks na żywo

Interaktywna tabela z sortowaniem i wyszukiwaniem

$$

$$

$$

  • Transakcyjne i detaliczne zbiory danych
  • Ćwiczenia w środowisku Databricks na żywo
Data Transformation with Spark SQL in Databricks

Gratulacje!

Data Transformation with Spark SQL in Databricks

Preparing Video For Download...