Introduction à PySpark
Benjamin Schmidt
Data Engineer
spark.read.csv("path/to/file.csv")
spark.read.json("path/to/file.json")
spark.read.parquet("path/to/file.parquet")
Spark peut déduire les schémas avec inferSchema=True
Définir le schéma manuellement pour plus de contrôle — utile pour des structures fixes

IntegerType : nombres entiers1, 3478, -18904569223347758063.14159"This is an example of a string."# Importer les types nécessaires comme classes
from pyspark.sql.types import (StructType,
StructField, IntegerType,
StringType, ArrayType)
# Construire le schéma
schema = StructType([
StructField("id", IntegerType(), True),
StructField("name", StringType(), True),
StructField("scores", ArrayType(IntegerType()), True)
])
# Appliquer le schéma
df = spark.createDataFrame(data, schema=schema)
.select() pour choisir des colonnes précises.filter() ou .where() pour filtrer selon des conditions.sort() pour trier par un ensemble de colonnes# Sélectionner et afficher seulement les colonnes name et age
df.select("name", "age").show()
# Filtrer sur age > 30
df.filter(df["age"] > 30).show()
# Utiliser where pour filtrer une valeur précise
df.where(df["age"] == 30).show()
# Utiliser sort pour trier par age
df.sort("age", ascending=False).show()
.sort() ou .orderBy()na.drop() pour supprimer les lignes avec des valeurs nulles# Trier selon la colonne age
df.sort("age", ascending=False).show()
# Supprimer les valeurs manquantes
df.na.drop().show()
spark.read_json() : charger des données JSONspark.read.schema() : définir explicitement les schémas.na.drop() : supprimer les lignes avec des valeurs manquantes.select(), .filter(), .sort(), .orderBy() : fonctions de manipulation de baseIntroduction à PySpark