Da dove iniziare

Feature Engineering con PySpark

John Hogue

Lead Data Scientist, General Mills

Tuffarsi subito nell'analisi

Qui ci sono mostri

  • Diventa il tuo esperto
  • Definisci gli obiettivi dell'analisi
  • Studia i tuoi dati
  • Sii curioso/a, fai domande

Mostri

Feature Engineering con PySpark

Il processo di Data Science

Processo di Data Science

Feature Engineering con PySpark

Spark cambia rapidamente e spesso

Feature Engineering con PySpark

Formati dei dati: Parquet

I dati sono forniti come Parquet

  • Memorizzati per colonne
    • Query veloci su sottoinsiemi di colonne
  • Strutturati, schema definito
    • Campi e tipi di dato definiti
    • Ottimo per testo disordinato
  • Standard di settore
    • Ottima competenza da avere! 😃

Formato file Parquet

Feature Engineering con PySpark

Portare i dati in Spark

Metodi read di PySpark

  • PySpark supporta molti tipi di file!
# JSON
spark.read.json('example.json')
# File CSV o delimitati
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Leggi un file Parquet in un DataFrame PySpark
df = spark.read.parquet('example.parq')
Feature Engineering con PySpark

Esercitiamoci!

Feature Engineering con PySpark

Preparing Video For Download...