De unde începem

Feature Engineering cu PySpark

John Hogue

Lead Data Scientist, General Mills

Direct la analiză

Aici sunt monștri

  • Deveniți propriul expert
  • Definiți obiectivele analizei
  • Cercetați datele
  • Fiți curioși, puneți întrebări

Monștri

Feature Engineering cu PySpark

Procesul Data Science

Procesul Data Science

Feature Engineering cu PySpark

Spark evoluează rapid și frecvent

Feature Engineering cu PySpark

Formate de date: Parquet

Datele sunt furnizate ca Parquet

  • Stocare pe coloane
    • Interogare rapidă a subseturilor de coloane
  • Schemă structurată și definită
    • Câmpuri și tipuri de date definite
    • Ideal pentru date text complexe
  • Adoptat în industrie
    • O abilitate valoroasă! 😃

Formatul de fișier Parquet

Feature Engineering cu PySpark

Încărcarea datelor în Spark

Metodele read din PySpark

  • PySpark suportă multe tipuri de fișiere!
# JSON
spark.read.json('example.json')
# CSV or delimited files
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Read a parquet file to a PySpark DataFrame
df = spark.read.parquet('example.parq')
Feature Engineering cu PySpark

Să exersăm!

Feature Engineering cu PySpark

Preparing Video For Download...