Kapanış

Databricks'te Spark SQL ile Veri Dönüştürme

Disha Mukherjee

Lead Data Engineer

Bölüm 1

Databricks çalışma alanına genel bakış

  • DataFrame'leri yükleme ve inceleme
  • Veriyi PySpark ve Spark SQL ile şekillendirme
Databricks'te Spark SQL ile Veri Dönüştürme

Bölüm 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Boşlar, kopyalar ve geçersiz kayıtları temizleme
  • Broadcast optimizasyonuyla toplulaştırma ve birleştirme
Databricks'te Spark SQL ile Veri Dönüştürme

Bölüm 3

Lakeflow pipeline DAG'i

  • Pencere fonksiyonları ve akış sorguları
  • Databricks Jobs ve Lakeflow ile üretim hatları
Databricks'te Spark SQL ile Veri Dönüştürme

Canlı bir Databricks çalışma alanında pratik

Sıralama ve arama içeren etkileşimli tablo

$$

$$

$$

  • İşlemsel ve çevrimiçi perakende veri kümeleri
  • Canlı bir Databricks çalışma alanında etkileşimli pratik
Databricks'te Spark SQL ile Veri Dönüştürme

Tebrikler!

Databricks'te Spark SQL ile Veri Dönüştürme

Preparing Video For Download...