समापन

Databricks में Spark SQL के साथ Data Transformation

Disha Mukherjee

Lead Data Engineer

अध्याय 1

Databricks वर्कस्पेस ओवरव्यू

  • DataFrames लोड करना और जाँचना
  • PySpark और Spark SQL से डेटा शेप करना
Databricks में Spark SQL के साथ Data Transformation

अध्याय 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Nulls, duplicates, और invalid रिकॉर्ड्स की सफाई
  • Aggregation और broadcast optimization के साथ joins
Databricks में Spark SQL के साथ Data Transformation

अध्याय 3

Lakeflow पाइपलाइन DAG

  • Window functions और streaming queries
  • Databricks Jobs और Lakeflow के साथ प्रोडक्शन पाइपलाइन्स
Databricks में Spark SQL के साथ Data Transformation

लाइव Databricks वर्कस्पेस में अभ्यास

सॉर्टिंग और सर्चिंग वाली इंटरैक्टिव टेबल

$$

$$

$$

  • ट्रांज़ैक्शनल और ऑनलाइन रिटेल डेटासेट्स
  • लाइव Databricks वर्कस्पेस में इंटरैक्टिव अभ्यास
Databricks में Spark SQL के साथ Data Transformation

बधाई हो!

Databricks में Spark SQL के साथ Data Transformation

Preparing Video For Download...