Feature Engineering mit PySpark
John Hogue
Lead Data Scientist, General Mills
Hier lauern Monster


Bestimmte Version (2.3.1)
Prüfe deine Versionen!
# return spark version
spark.version
# return python version
import sys
sys.version_info
Daten kommen als Parquet

PySpark-read-Methoden
# JSON
spark.read.json('example.json')
# CSV oder durch Trennzeichen getrennte Dateien
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lies eine Parquet-Datei in ein PySpark DataFrame
df = spark.read.parquet('example.parq')
Feature Engineering mit PySpark