Feature Engineering con PySpark
John Hogue
Lead Data Scientist, General Mills
Qui ci sono mostri


Versione specifica (2.3.1)
Controlla le tue versioni!
# return spark version
spark.version
# return python version
import sys
sys.version_info
I dati sono forniti come Parquet

Metodi read di PySpark
# JSON
spark.read.json('example.json')
# File CSV o delimitati
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Leggi un file Parquet in un DataFrame PySpark
df = spark.read.parquet('example.parq')
Feature Engineering con PySpark