Ingeniería de características con PySpark
John Hogue
Lead Data Scientist, General Mills
Aquí hay monstruos


Versión específica (2.3.1)
¡Comprueba tus versiones!
# return spark version
spark.version
# return python version
import sys
sys.version_info
Los datos se entregan como Parquet

Métodos read de PySpark
# JSON
spark.read.json('example.json')
# CSV o archivos delimitados
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lee un archivo Parquet a un DataFrame de PySpark
df = spark.read.parquet('example.parq')
Ingeniería de características con PySpark