Tipuri de clustere și runtimes

Introducere în Databricks Lakehouse

Gang Wang

Senior Data Scientist

Ce este un cluster?

$$

  • Un set de mașini virtuale care rulează codul tău
  • Un nod driver coordonează activitatea
  • Unul sau mai multe noduri worker efectuează procesarea
  • Clusterele citesc date din stocarea în cloud

$$

$$

ierarhie: Nod Driver, Worker 1, Worker 2, Worker 3, Stocare Cloud

Introducere în Databricks Lakehouse

Clustere de uz general

$$

  • Dezvoltare interactivă și interogări ad-hoc
  • Partajate între mai mulți utilizatori dintr-o echipă
  • Rămân active până le oprești manual
  • Gândește-te la ele ca la o mașină personală — mereu disponibilă, dar costă chiar și când nu o folosești

$$

recraft: half: O mașină personală parcată în curte, mereu disponibilă, dar cu costuri chiar și când nu este folosită, reprezentând o resursă de calcul permanent activă

Introducere în Databricks Lakehouse

Clustere pentru joburi

$$

  • Create automat la pornirea unui job
  • Rulează o singură sarcină, apoi se închid
  • Nu necesită administrare manuală
  • Optimizate ca și cost pentru workload-uri de producție

$$

recraft: half: Un taxi modern cu un aparat de taxat aprins, reprezentând o resursă de calcul la cerere care pornește și se oprește automat

Introducere în Databricks Lakehouse

Când folosești care?

$$

comparație: Uz general – dezvoltare interactivă, lucru în notebook, SQL ad-hoc, partajare în echipă | Joburi – ETL nocturn, rapoarte programate, testare automată, producție

  • Greșeală frecventă: rularea pipeline-urilor de producție pe clustere de uz general
Introducere în Databricks Lakehouse

Databricks Runtime

$$

  • Stack software versionat care rulează pe fiecare cluster
  • Include Apache Spark, Delta Lake, Python, R, Scala
  • Versiunile LTS – suport pe termen lung, recomandate pentru producție
  • ML Runtime adaugă biblioteci ML preinstalate

$$

straturi: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Biblioteci sistem

Introducere în Databricks Lakehouse

Rezumat

$$

  • Clustere de uz general – interactive, partajate, administrate manual
  • Clustere pentru joburi – automate, o singură sarcină, optimizate ca și cost
  • Databricks Runtime – stack software versionat (folosește LTS pentru producție)
  • Alege tipul de cluster potrivit workload-ului pentru a controla costurile
Introducere în Databricks Lakehouse

Hai să exersăm!

Introducere în Databricks Lakehouse

Preparing Video For Download...