Підсумки

Перетворення даних за допомогою Spark SQL у Databricks

Disha Mukherjee

Lead Data Engineer

Розділ 1

Огляд робочого простору Databricks

  • Завантаження й огляд DataFrame
  • Формування даних за допомогою PySpark і Spark SQL
Перетворення даних за допомогою Spark SQL у Databricks

Розділ 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Очищення null-значень, дублікатів і некоректних записів
  • Агрегації та об'єднання з оптимізацією broadcast
Перетворення даних за допомогою Spark SQL у Databricks

Розділ 3

DAG конвеєра Lakeflow

  • Віконні функції та потокові запити
  • Продуктивні конвеєри з Databricks Jobs і Lakeflow
Перетворення даних за допомогою Spark SQL у Databricks

Практика у живому робочому середовищі Databricks

Інтерактивна таблиця з сортуванням і пошуком

$$

$$

$$

  • Транзакційні та онлайн-роздрібні набори даних
  • Інтерактивна практика в живому робочому середовищі Databricks
Перетворення даних за допомогою Spark SQL у Databricks

Вітаємо!

Перетворення даних за допомогою Spark SQL у Databricks

Preparing Video For Download...