Par où commencer

Feature Engineering avec PySpark

John Hogue

Lead Data Scientist, General Mills

Plonger directement dans l'analyse

Ici, il y a des monstres

  • Devenez votre propre expert
  • Définir les objectifs de l'analyse
  • Explorer vos données
  • Être curieux, poser des questions

Monstres

Feature Engineering avec PySpark

Le processus de Data Science

Processus Data Science

Feature Engineering avec PySpark

Spark évolue vite et souvent

Feature Engineering avec PySpark

Formats de données : Parquet

Les données sont fournies en Parquet

  • Stockage par colonnes
    • Requêtes rapides sur des sous-ensembles de colonnes
  • Structuré, schéma défini
    • Champs et types définis
    • Idéal pour du texte désordonné
  • Adopté par l'industrie
    • Une compétence précieuse ! 😃

Format de fichier Parquet

Feature Engineering avec PySpark

Charger les données dans Spark

Méthodes PySpark read

  • PySpark prend en charge de nombreux formats !
# JSON
spark.read.json('example.json')
# Fichiers CSV ou délimités
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lire un fichier Parquet dans un DataFrame PySpark
df = spark.read.parquet('example.parq')
Feature Engineering avec PySpark

Passons à la pratique !

Feature Engineering avec PySpark

Preparing Video For Download...