สรุปบทเรียน

การแปลงข้อมูลด้วย Spark SQL ใน Databricks

Disha Mukherjee

Lead Data Engineer

บทที่ 1

ภาพรวม Databricks workspace

  • การโหลดและตรวจสอบ DataFrame
  • การจัดรูปแบบข้อมูลด้วย PySpark และ Spark SQL
การแปลงข้อมูลด้วย Spark SQL ใน Databricks

บทที่ 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • การจัดการค่า null ค่าซ้ำ และระเบียนที่ไม่ถูกต้อง
  • การรวมข้อมูลและการ join ด้วย broadcast optimization
การแปลงข้อมูลด้วย Spark SQL ใน Databricks

บทที่ 3

DAG ของ Lakeflow pipeline

  • Window function และ streaming query
  • Production pipeline ด้วย Databricks Jobs และ Lakeflow
การแปลงข้อมูลด้วย Spark SQL ใน Databricks

ฝึกปฏิบัติใน Databricks workspace จริง

ตารางแบบโต้ตอบพร้อมการเรียงลำดับและค้นหา

$$

$$

$$

  • ชุดข้อมูลธุรกรรมและค้าปลีกออนไลน์
  • ฝึกปฏิบัติจริงใน Databricks workspace
การแปลงข้อมูลด้วย Spark SQL ใน Databricks

ยินดีด้วย!

การแปลงข้อมูลด้วย Spark SQL ใน Databricks

Preparing Video For Download...