Immutabilité et traitement paresseux

Nettoyer des données avec PySpark

Mike Metzger

Data Engineering Consultant

Rappel sur les variables

Variables Python :

  • Mutables
  • Flexibilité
  • Risque de problèmes en concurrence
  • Peut ajouter de la complexité
Nettoyer des données avec PySpark

Immutabilité

Les variables immuables sont :

  • Un élément de la programmation fonctionnelle
  • Définies une seule fois
  • Impossible à modifier directement
  • Recréées lors d'une réaffectation
  • Partageables efficacement
Nettoyer des données avec PySpark

Exemple d'immuabilité

Définir une nouvelle trame de données :

voter_df = spark.read.csv('voterdata.csv')

Apporter des changements :

voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)

voter_df = voter_df.drop(voter_df.year)
Nettoyer des données avec PySpark

Traitement paresseux

  • N'est-ce pas lent ?
  • Transformations
  • Actions
  • Permet une planification efficace
voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)

voter_df.count()
Nettoyer des données avec PySpark

Passons à la pratique !

Nettoyer des données avec PySpark

Preparing Video For Download...