Consigli per dimensionare il cluster

Pulizia dei dati con PySpark

Mike Metzger

Data Engineering Consultant

Opzioni di configurazione

  • Spark ha molte impostazioni di configurazione
  • Puoi modificarle in base alle esigenze
  • Leggere le impostazioni:
    spark.conf.get(<configuration name>)
    
  • Scrivere le impostazioni
    spark.conf.set(<configuration name>)
    
Pulizia dei dati con PySpark

Tipi di cluster

Opzioni di deployment di Spark:

  • Single node
  • Standalone
  • Gestito
    • YARN
    • Mesos
    • Kubernetes
Pulizia dei dati con PySpark

Driver

  • Assegnazione dei task
  • Consolidamento dei risultati
  • Accesso condiviso ai dati

Suggerimenti:

  • Il driver dovrebbe avere il doppio della memoria dei worker
  • Storage locale veloce è utile
Pulizia dei dati con PySpark

Worker

  • Esegue i task
  • Idealmente ha tutto: codice, dati e risorse per il task

Raccomandazioni:

  • Più worker è spesso meglio che worker più grandi
  • Fai test per trovare il giusto equilibrio
  • Storage locale molto veloce è utilissimo
Pulizia dei dati con PySpark

Passiamo alla pratica !

Pulizia dei dati con PySpark

Preparing Video For Download...