Tipuri de clustere și runtimes
Introducere în Databricks Lakehouse
Gang Wang
Senior Data Scientist
Ce este un cluster?
$$
Un
set de mașini virtuale
care rulează codul tău
Un nod
driver
coordonează activitatea
Unul sau mai multe noduri
worker
efectuează procesarea
Clusterele citesc date din stocarea în cloud
$$
$$
Clustere de uz general
$$
Dezvoltare
interactivă
și interogări ad-hoc
Partajate
între mai mulți utilizatori dintr-o echipă
Rămân active până le oprești
manual
Gândește-te la ele ca la o mașină personală — mereu disponibilă, dar costă chiar și când nu o folosești
$$
Clustere pentru joburi
$$
Create
automat
la pornirea unui job
Rulează o
singură sarcină
, apoi se închid
Nu necesită administrare manuală
Optimizate ca și cost
pentru workload-uri de producție
$$
Când folosești care?
$$
Greșeală frecventă:
rularea pipeline-urilor de producție pe clustere de uz general
Databricks Runtime
$$
Stack software versionat
care rulează pe fiecare cluster
Include Apache Spark, Delta Lake, Python, R, Scala
Versiunile
LTS
– suport pe termen lung, recomandate pentru producție
ML Runtime
adaugă biblioteci ML preinstalate
$$
Rezumat
$$
Clustere de uz general
– interactive, partajate, administrate manual
Clustere pentru joburi
– automate, o singură sarcină, optimizate ca și cost
Databricks Runtime
– stack software versionat (folosește LTS pentru producție)
Alege tipul de cluster potrivit workload-ului pentru a controla costurile
Hai să exersăm!
Introducere în Databricks Lakehouse
Preparing Video For Download...