Klustertyper och runtimes

Introduktion till Databricks Lakehouse

Gang Wang

Senior Data Scientist

Vad är ett kluster?

$$

  • En uppsättning virtuella maskiner som kör din kod
  • En driver-nod samordnar arbetet
  • En eller flera worker-noder utför bearbetningen
  • Kluster läser data från molnlagring

$$

$$

hierarki: Driver Node, Worker 1, Worker 2, Worker 3, Cloud Storage

Introduktion till Databricks Lakehouse

All-purpose-kluster

$$

  • Interaktiv utveckling och ad hoc-frågor
  • Delas av flera användare i ett team
  • Körs tills du manuellt stoppar dem
  • Tänk dig en egen bil – alltid tillgänglig, men du betalar även när den står parkerad

$$

recraft: half: En personbil parkerad på en uppfart, alltid tillgänglig men kostar pengar även när den inte används, som en beräkningsresurs som alltid är igång

Introduktion till Databricks Lakehouse

Jobbkluster

$$

  • Skapas automatiskt när ett jobb startar
  • Kör en enskild uppgift och avslutas sedan
  • Ingen manuell hantering krävs
  • Kostnadsoptimerade för produktionsarbetsbelastningar

$$

recraft: half: En modern taxi med en lysande mätare på taket, som representerar en beräkningsresurs på begäran som startar och stoppas automatiskt

Introduktion till Databricks Lakehouse

När använder du vilket?

$$

jämförelse: All-Purpose, Interaktiv dev, Notebookarbete, Ad hoc-SQL, Teamdelning | Jobs, Nattlig ETL, Schemalagda rapporter, Automatiserad testning, Produktion

  • Vanligt misstag: att köra produktionspipelines på all-purpose-kluster
Introduktion till Databricks Lakehouse

Databricks Runtime

$$

  • Versionshanterad programvarustack som körs på varje kluster
  • Inkluderar Apache Spark, Delta Lake, Python, R, Scala
  • LTS-versioner – långtidssupport, rekommenderas för produktion
  • ML Runtime lägger till förinstallerade ML-bibliotek

$$

lager: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Systembibliotek

Introduktion till Databricks Lakehouse

Sammanfattning

$$

  • All-purpose-kluster – interaktiva, delade, manuellt hanterade
  • Jobbkluster – automatiserade, enskild uppgift, kostnadsoptimerade
  • Databricks Runtime – versionshanterad programvarustack (använd LTS för produktion)
  • Matcha klustertypen med arbetsbelastningen för att hålla kostnaderna nere
Introduktion till Databricks Lakehouse

Nu kör vi en övning!

Introduktion till Databricks Lakehouse

Preparing Video For Download...