Clustertypen und Runtimes
Einführung in das Databricks Lakehouse
Gang Wang
Senior Data Scientist
Was ist ein Cluster?
$$
Ein
Satz virtueller Maschinen
, die deinen Code ausführen
Ein
Driver
-Knoten koordiniert die Arbeit
Einer oder mehrere
Worker
-Knoten verarbeiten die Aufgaben
Cluster lesen Daten aus Cloud-Speicher
$$
$$
Allzweck-Cluster
$$
Interaktive
Entwicklung und Ad-hoc-Abfragen
Von Teams gemeinsam
genutzt
Läuft weiter, bis du es
manuell
stoppst
Denk an ein eigenes Auto – immer verfügbar, kostet aber auch im Stand
$$
Jobs-Cluster
$$
Wird
automatisch
gestartet, wenn ein Job beginnt
Führt
eine einzelne Aufgabe
aus, dann beendet es sich
Keine manuelle Verwaltung nötig
Kostenoptimiert
für Produktions-Workloads
$$
Wann welches nutzen?
$$
Häufiger Fehler:
Produktions-Pipelines auf Allzweck-Clustern ausführen
Databricks Runtime
$$
Versionierter Software-Stack
, der auf jedem Cluster läuft
Enthält Apache Spark, Delta Lake, Python, R, Scala
LTS
-Versionen – Long-Term Support, empfohlen für Produktion
ML Runtime
ergänzt vorinstallierte ML-Bibliotheken
$$
Zusammenfassung
$$
Allzweck-Cluster
– interaktiv, gemeinsam genutzt, manuell verwaltet
Jobs-Cluster
– automatisiert, Einmal-Task, kostenoptimiert
Databricks Runtime
– versionierter Software-Stack (für Produktion LTS nutzen)
Clustertyp zur Aufgabe passend wählen, um Kosten zu steuern
Lass uns üben!
Einführung in das Databricks Lakehouse
Preparing Video For Download...