Penutup

Transformasi Data dengan Spark SQL di Databricks

Disha Mukherjee

Lead Data Engineer

Bab 1

Gambaran umum workspace Databricks

  • Memuat dan memeriksa DataFrame
  • Membentuk data dengan PySpark dan Spark SQL
Transformasi Data dengan Spark SQL di Databricks

Bab 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Membersihkan nilai null, duplikat, dan catatan tidak valid
  • Agregasi dan join dengan optimisasi broadcast
Transformasi Data dengan Spark SQL di Databricks

Bab 3

DAG pipeline Lakeflow

  • Fungsi window dan kueri streaming
  • Pipeline produksi dengan Databricks Jobs dan Lakeflow
Transformasi Data dengan Spark SQL di Databricks

Berlatih di workspace Databricks live

Tabel interaktif dengan pengurutan dan pencarian

$$

$$

$$

  • Himpunan data transaksi dan ritel daring
  • Latihan interaktif di workspace Databricks live
Transformasi Data dengan Spark SQL di Databricks

Selamat!

Transformasi Data dengan Spark SQL di Databricks

Preparing Video For Download...