Conseils pour dimensionner un cluster

Nettoyer des données avec PySpark

Mike Metzger

Data Engineering Consultant

Options de configuration

  • Spark propose de nombreux paramètres de configuration
  • Ils peuvent être ajustés selon vos besoins
  • Lire un paramètre :
    spark.conf.get(<configuration name>)
    
  • Écrire un paramètre
    spark.conf.set(<configuration name>)
    
Nettoyer des données avec PySpark

Types de clusters

Options de déploiement Spark :

  • Nœud unique
  • Autonome
  • Géré
    • YARN
    • Mesos
    • Kubernetes
Nettoyer des données avec PySpark

Pilote

  • Affectation des tâches
  • Consolidation des résultats
  • Accès partagé aux données

Conseils :

  • Le nœud pilote devrait avoir le double de mémoire des travailleurs
  • Un stockage local rapide est utile
Nettoyer des données avec PySpark

Travailleur

  • Exécute les tâches
  • Idéalement, contient tout le code, les données et les ressources pour une tâche donnée

Recommandations :

  • Plus de nœuds travailleurs vaut souvent mieux que des travailleurs plus gros
  • Faites des essais pour trouver l'équilibre
  • Un stockage local très rapide est extrêmement utile
Nettoyer des données avec PySpark

Passons à la pratique !

Nettoyer des données avec PySpark

Preparing Video For Download...