Par où commencer

Ingénierie des caractéristiques avec PySpark

John Hogue

Lead Data Scientist, General Mills

Plonger directement dans l'analyse

Ici, il y a des monstres

  • Devenez votre propre expert(e)
  • Définir les objectifs de l'analyse
  • Faire des recherches sur vos données
  • Soyez curieux, posez des questions

Monstres

Ingénierie des caractéristiques avec PySpark

Le processus de Data Science

Processus Data Science

Ingénierie des caractéristiques avec PySpark

Spark évolue vite et souvent

Ingénierie des caractéristiques avec PySpark

Formats de données : Parquet

Les données sont fournies en Parquet

  • Stockage par colonnes
    • Rapide pour interroger des sous-ensembles de colonnes
  • Structuré, schéma défini
    • Champs et types de données définis
    • Idéal pour des textes brouillons
  • Adopté par l'industrie
    • Une bonne compétence à avoir ! 😃

Format de fichier Parquet

Ingénierie des caractéristiques avec PySpark

Acheminer les données vers Spark

Méthodes read de PySpark

  • PySpark prend en charge de nombreux types de fichiers !
# JSON
spark.read.json('example.json')
# Fichiers CSV ou délimités
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Lire un fichier Parquet dans un DataFrame PySpark
df = spark.read.parquet('example.parq')
Ingénierie des caractéristiques avec PySpark

Passons à la pratique !

Ingénierie des caractéristiques avec PySpark

Preparing Video For Download...