Travailler avec les carnets Databricks

Transformation des données avec Spark SQL dans Databricks

Disha Mukherjee

Lead Data Engineer

Votre instructrice

$$

$$

$$

Disha Mukherjee

  • Ingénieure de données principale
  • A travaillé chez Ford Credit, Just Eat et PayU

 

Photo de l'instructrice

Transformation des données avec Spark SQL dans Databricks

$$

Introduction à Databricks SQL

$$

$$

  • Vous appliquerez les compétences dans Databricks 🧱

$$

Introduction à PySpark

Transformation des données avec Spark SQL dans Databricks

À quoi vous attendre

Icônes pour carnets, données, transformations

Transformation des données avec Spark SQL dans Databricks

Qu'est-ce que Databricks ?

Aperçu de l'espace de travail Databricks

  • Offre des outils pour l'ingénierie et l'analytique 📊
  • Gère l'approvisionnement et la mise à l'échelle pour nous 🔄
Transformation des données avec Spark SQL dans Databricks

Grappes et Spark

Schéma du pilote et des nœuds travailleurs

  • Spark traite efficacement de grands ensembles de données 🚀
  • Les exercices utilisent le calcul sans serveur : même architecture, aucune configuration
Transformation des données avec Spark SQL dans Databricks

Carnets Databricks

Carnet Databricks avec plusieurs cellules

Transformation des données avec Spark SQL dans Databricks

Présentation de l'ensemble de données

Aperçu d'un tableau de transactions clients

Transformation des données avec Spark SQL dans Databricks

Volumes Unity Catalog

IU du catalogue montrant un volume avec l'option Téléverser vers le volume

Transformation des données avec Spark SQL dans Databricks

Charger des données dans un DataFrame

path = "/Volumes/.../default/transactions.csv"
df = spark.read.csv(path, header=True, inferSchema=True)
df:pyspark.sql.connect.dataframe.DataFrame
    ID:integer
    Date:timestamp
    Customer_ID:string
    ....
    Transaction_Status:string
Transformation des données avec Spark SQL dans Databricks

Inspecter le DataFrame

df.printSchema()
root
 |-- ID: integer (nullable = true)
 |-- Date: timestamp (nullable = true)
 ...
 |-- Transaction_Status: string (nullable = true)
Transformation des données avec Spark SQL dans Databricks

Aperçu des données

df.show(5, truncate=False)

Aperçu des résultats dans Databricks

Transformation des données avec Spark SQL dans Databricks

Journaux du pilote

Journaux du pilote

Transformation des données avec Spark SQL dans Databricks

Passons à la pratique !

Transformation des données avec Spark SQL dans Databricks

Preparing Video For Download...