Tipi di cluster e runtime
Introduzione a Databricks Lakehouse
Gang Wang
Senior Data Scientist
Cos'è un cluster?
$$
Un
insieme di macchine virtuali
che eseguono il tuo codice
Un nodo
driver
coordina il lavoro
Uno o più nodi
worker
eseguono l'elaborazione
I cluster leggono i dati dallo storage cloud
$$
$$
All-purpose clusters
$$
Sviluppo
interattivo
e query ad hoc
Condiviso
tra più utenti del team
Resta attivo finché non lo fermi
manualmente
Pensalo come la tua auto personale: sempre disponibile, ma paghi anche quando è parcheggiata
$$
Jobs clusters
$$
Creati
automaticamente
all'avvio di un job
Eseguono un
singolo task
, poi terminano
Nessuna gestione manuale richiesta
Ottimizzati nei costi
per ambienti di produzione
$$
Quando usare cosa?
$$
Errore comune:
eseguire pipeline di produzione su all-purpose clusters
Databricks Runtime
$$
Stack software versionato
che gira su ogni cluster
Include Apache Spark, Delta Lake, Python, R, Scala
Versioni
LTS
- supporto a lungo termine, consigliate per la produzione
ML Runtime
aggiunge librerie ML preinstallate
$$
Riepilogo
$$
All-purpose clusters
- interattivi, condivisi, gestiti manualmente
Jobs clusters
- automatizzati, mono-task, ottimizzati nei costi
Databricks Runtime
- stack software versionato (usa LTS in produzione)
Abbina il tipo di cluster al carico per controllare i costi
Esercitiamoci!
Introduzione a Databricks Lakehouse
Preparing Video For Download...