En résumé

Transformation des données avec Spark SQL dans Databricks

Disha Mukherjee

Lead Data Engineer

Chapitre 1

Aperçu de l'espace de travail Databricks

  • Chargement et inspection de DataFrames
  • Mise en forme des données avec PySpark et Spark SQL
Transformation des données avec Spark SQL dans Databricks

Chapitre 2

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • Nettoyage des valeurs nulles, doublons et enregistrements invalides
  • Agrégation et jointures avec optimisation broadcast
Transformation des données avec Spark SQL dans Databricks

Chapitre 3

DAG de pipeline Lakeflow

  • Fonctions de fenêtre et requêtes en continu
  • Pipelines de production avec Databricks Jobs et Lakeflow
Transformation des données avec Spark SQL dans Databricks

Pratique dans un espace de travail Databricks en direct

Tableau interactif avec tri et recherche

$$

$$

$$

  • Jeux de données transactionnels et de vente en ligne
  • Pratique interactive dans un espace de travail Databricks en direct
Transformation des données avec Spark SQL dans Databricks

Félicitations !

Transformation des données avec Spark SQL dans Databricks

Preparing Video For Download...