Introduction à PySpark
Benjamin Schmidt
Data Engineer
Utilisation de PySpark pour le Machine Learning, des tâches ETL, et bien plus
Enseignant enthousiaste des nouveaux outils pour tous et toutes
-
Traitement distribué : conçu pour de grands ensembles de données sur des grappes
Prend en charge divers formats, dont CSV, Parquet et JSON
Intégration SQL : requêtes en Python ou en SQL
Optimisé pour la vitesse à grande échelle

Analytique de mégadonnées
Traitement distribué
Diffusion de données en temps réel
Machine Learning sur de grands ensembles de données
Pipelines ETL et ELT
Utilisation de sources variées :


# Import SparkSession
from pyspark.sql import SparkSession
# Initialize a SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
$$
.builder() configure une sessiongetOrCreate() crée ou récupère une session.appName() aide à gérer plusieurs sessions# Import and initialize a Spark session
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("MySparkApp").getOrCreate()
# Create a DataFrame
census_df = spark.read.csv("census.csv",
["gender","age","zipcode","salary_range_usd","marriage_status"])
# Show the DataFrame
census_df.show()
Introduction à PySpark