Clustertypen und Runtimes

Einführung in das Databricks Lakehouse

Gang Wang

Senior Data Scientist

Was ist ein Cluster?

$$

  • Ein Satz virtueller Maschinen, die deinen Code ausführen
  • Ein Driver-Knoten koordiniert die Arbeit
  • Einer oder mehrere Worker-Knoten verarbeiten die Aufgaben
  • Cluster lesen Daten aus Cloud-Speicher

$$

$$

Hierarchie: Driver-Node, Worker 1, Worker 2, Worker 3, Cloud-Speicher

Einführung in das Databricks Lakehouse

Allzweck-Cluster

$$

  • Interaktive Entwicklung und Ad-hoc-Abfragen
  • Von Teams gemeinsam genutzt
  • Läuft weiter, bis du es manuell stoppst
  • Denk an ein eigenes Auto – immer verfügbar, kostet aber auch im Stand

$$

recraft: half: Ein Privatwagen in einer Einfahrt, immer verfügbar, kostet aber auch im Leerlauf – steht für eine Always-on-Compute-Ressource

Einführung in das Databricks Lakehouse

Jobs-Cluster

$$

  • Wird automatisch gestartet, wenn ein Job beginnt
  • Führt eine einzelne Aufgabe aus, dann beendet es sich
  • Keine manuelle Verwaltung nötig
  • Kostenoptimiert für Produktions-Workloads

$$

recraft: half: Ein modernes Taxi mit leuchtendem Taxameter – steht für eine On-Demand-Compute-Ressource, die automatisch startet und stoppt

Einführung in das Databricks Lakehouse

Wann welches nutzen?

$$

Vergleich: Allzweck, Interaktive Entwicklung, Notebook-Arbeit, Ad-hoc-SQL, Team-Sharing | Jobs, Nächtliches ETL, Geplante Berichte, Auto-Tests, Produktion

  • Häufiger Fehler: Produktions-Pipelines auf Allzweck-Clustern ausführen
Einführung in das Databricks Lakehouse

Databricks Runtime

$$

  • Versionierter Software-Stack, der auf jedem Cluster läuft
  • Enthält Apache Spark, Delta Lake, Python, R, Scala
  • LTS-Versionen – Long-Term Support, empfohlen für Produktion
  • ML Runtime ergänzt vorinstallierte ML-Bibliotheken

$$

Schichten: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Systembibliotheken

Einführung in das Databricks Lakehouse

Zusammenfassung

$$

  • Allzweck-Cluster – interaktiv, gemeinsam genutzt, manuell verwaltet
  • Jobs-Cluster – automatisiert, Einmal-Task, kostenoptimiert
  • Databricks Runtime – versionierter Software-Stack (für Produktion LTS nutzen)
  • Clustertyp zur Aufgabe passend wählen, um Kosten zu steuern
Einführung in das Databricks Lakehouse

Lass uns üben!

Einführung in das Databricks Lakehouse

Preparing Video For Download...