Tổng kết

Chuyển đổi dữ liệu với Spark SQL trong Databricks

Disha Mukherjee

Lead Data Engineer

Chương 1

Tổng quan không gian làm việc Databricks

  • Nạp và khám phá DataFrame
  • Định hình dữ liệu với PySpark và Spark SQL
Chuyển đổi dữ liệu với Spark SQL trong Databricks

Chương 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Làm sạch giá trị null, trùng lặp và bản ghi không hợp lệ
  • Tổng hợp và JOIN với tối ưu hóa broadcast
Chuyển đổi dữ liệu với Spark SQL trong Databricks

Chương 3

DAG pipeline Lakeflow

  • Hàm window và truy vấn streaming
  • Pipeline sản xuất với Databricks Jobs và Lakeflow
Chuyển đổi dữ liệu với Spark SQL trong Databricks

Luyện tập trong không gian làm việc Databricks trực tiếp

Bảng tương tác có sắp xếp và tìm kiếm

$$

$$

$$

  • Bộ dữ liệu giao dịch và bán lẻ trực tuyến
  • Luyện tập tương tác trong không gian làm việc Databricks trực tiếp
Chuyển đổi dữ liệu với Spark SQL trong Databricks

Chúc mừng!

Chuyển đổi dữ liệu với Spark SQL trong Databricks

Preparing Video For Download...