Waar begin je

Feature Engineering met PySpark

John Hogue

Lead Data Scientist, General Mills

Direct de analyse in duiken

Hier zijn monsters

  • Word je eigen expert
  • Bepaal doelen van je analyse
  • Onderzoek je data
  • Wees nieuwsgierig, stel vragen

Monsters

Feature Engineering met PySpark

Het Data Science-proces

Data Science-proces

Feature Engineering met PySpark

Spark verandert snel en vaak

Feature Engineering met PySpark

Dataformaten: Parquet

Data wordt aangeleverd als Parquet

  • Kolomgericht opgeslagen
    • Snel kolomsubsets bevragen
  • Gestructureerd, gedefinieerd schema
    • Velden en datatypen gedefinieerd
    • Ideaal voor rommelige tekstdata
  • Breed gebruikt in de industrie
    • Handige skill om te hebben! 😃

Parquet-bestandsindeling

Feature Engineering met PySpark

Data naar Spark krijgen

PySpark-read-methoden

  • PySpark ondersteunt veel bestandssoorten!
# JSON
spark.read.json('example.json')
# CSV of door scheidingsteken gescheiden bestanden
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lees een Parquet-bestand in een PySpark DataFrame
df = spark.read.parquet('example.parq')
Feature Engineering met PySpark

Laten we oefenen!

Feature Engineering met PySpark

Preparing Video For Download...