Wo fängst du an?

Feature Engineering mit PySpark

John Hogue

Lead Data Scientist, General Mills

Direkt in die Analyse eintauchen

Hier lauern Monster

  • Werde selbst Expert:in
  • Ziele der Analyse festlegen
  • Recherchiere deine Daten
  • Sei neugierig, stell Fragen

Monster

Feature Engineering mit PySpark

Der Data-Science-Prozess

Data-Science-Prozess

Feature Engineering mit PySpark

Spark ändert sich schnell und oft

Feature Engineering mit PySpark

Datenformate: Parquet

Daten kommen als Parquet

  • Spaltenweise gespeichert
    • Schnell für Spaltenabfragen
  • Strukturiert, Schema definiert
    • Felder und Datentypen festgelegt
    • Super für unordentliche Textdaten
  • In der Industrie verbreitet
    • Eine gute Fähigkeit! 😃

Parquet-Dateiformat

Feature Engineering mit PySpark

Daten nach Spark bringen

PySpark-read-Methoden

  • PySpark unterstützt viele Dateitypen!
# JSON
spark.read.json('example.json')
# CSV oder durch Trennzeichen getrennte Dateien
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lies eine Parquet-Datei in ein PySpark DataFrame
df = spark.read.parquet('example.parq')
Feature Engineering mit PySpark

Lass uns üben!

Feature Engineering mit PySpark

Preparing Video For Download...