Kde začít

Feature Engineering with PySpark

John Hogue

Lead Data Scientist, General Mills

Přímý skok k analýze

Zde jsou příšery

  • Staňte se vlastním expertem
  • Definujte cíle analýzy
  • Prozkoumejte svá data
  • Buďte zvídaví, ptejte se

Příšery

Feature Engineering with PySpark

Proces datové vědy

Proces datové vědy

Feature Engineering with PySpark

Spark se mění rychle a často

Feature Engineering with PySpark

Datové formáty: Parquet

Data jsou dodávána ve formátu Parquet

  • Sloupcové uložení
    • Rychlé dotazy na podmnožiny sloupců
  • Strukturované, definované schéma
    • Definovaná pole a datové typy
    • Vhodné pro nestrukturovaná textová data
  • Průmyslový standard
    • Užitečná dovednost! 😃

Formát souboru Parquet

Feature Engineering with PySpark

Načítání dat do Sparku

Metody read v PySparku

  • PySpark podporuje mnoho typů souborů!
# JSON
spark.read.json('example.json')
# CSV nebo soubory s oddělovačem
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Read a parquet file to a PySpark DataFrame
df = spark.read.parquet('example.parq')
Feature Engineering with PySpark

Vamos praticar!

Feature Engineering with PySpark

Preparing Video For Download...