Ingénierie des caractéristiques avec PySpark
John Hogue
Lead Data Scientist, General Mills
Ici, il y a des monstres


Version précise (2.3.1)
Vérifiez vos versions !
# return spark version
spark.version
# return python version
import sys
sys.version_info
Les données sont fournies en Parquet

Méthodes read de PySpark
# JSON
spark.read.json('example.json')
# Fichiers CSV ou délimités
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lire un fichier Parquet dans un DataFrame PySpark
df = spark.read.parquet('example.parq')
Ingénierie des caractéristiques avec PySpark