Introduction à PySpark

Introduction à PySpark

Benjamin Schmidt

Data Engineer

Faites connaissance avec votre instructeur

  • Près de dix ans d'expérience en données avec PySpark
  • Utilisation de PySpark pour le Machine Learning, des tâches ETL, et bien plus

  • Enseignant enthousiaste des nouveaux outils pour tous et toutes

-Ben Schmidt

Introduction à PySpark

Qu'est-ce que PySpark ?

  • Traitement distribué : conçu pour de grands ensembles de données sur des grappes

  • Prend en charge divers formats, dont CSV, Parquet et JSON

  • Intégration SQL : requêtes en Python ou en SQL

  • Optimisé pour la vitesse à grande échelle

Écosystème de données

Introduction à PySpark

Quand utiliser PySpark ?

  • Analytique de mégadonnées

  • Traitement distribué

  • Diffusion de données en temps réel

  • Machine Learning sur de grands ensembles de données

  • Pipelines ETL et ELT

  • Utilisation de sources variées :

    1. CSV
    2. JSON
    3. Parquet
    4. Et bien d'autres
Introduction à PySpark

Grappe Spark

Nœud maître

  • Gère la grappe, coordonne les tâches et planifie les travaux

Nœuds travailleurs

  • Exécutent les tâches assignées par le maître
  • Responsables des calculs et de l'entreposage en mémoire ou sur disque

Nœud maître

Nœud travailleur

Introduction à PySpark

SparkSession

  • Les SparkSession donnent accès à votre grappe Spark et sont essentielles pour utiliser PySpark.
# Import SparkSession
from pyspark.sql import SparkSession

# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

$$

  • .builder() configure une session
  • getOrCreate() crée ou récupère une session
  • .appName() aide à gérer plusieurs sessions
Introduction à PySpark

DataFrames PySpark

  • Semblables aux autres DataFrames, mais
  • Optimisées pour PySpark
# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()

# Create a DataFrame
census_df = spark.read.csv("census.csv",
                ["gender","age","zipcode","salary_range_usd","marriage_status"])

# Show the DataFrame
census_df.show()

Introduction à PySpark

Passons à la pratique !

Introduction à PySpark

Preparing Video For Download...