Klustertyper och runtimes
Introduktion till Databricks Lakehouse
Gang Wang
Senior Data Scientist
Vad är ett kluster?
$$
En
uppsättning virtuella maskiner
som kör din kod
En
driver
-nod samordnar arbetet
En eller flera
worker
-noder utför bearbetningen
Kluster läser data från molnlagring
$$
$$
All-purpose-kluster
$$
Interaktiv
utveckling och ad hoc-frågor
Delas
av flera användare i ett team
Körs tills du
manuellt
stoppar dem
Tänk dig en egen bil – alltid tillgänglig, men du betalar även när den står parkerad
$$
Jobbkluster
$$
Skapas
automatiskt
när ett jobb startar
Kör en
enskild uppgift
och avslutas sedan
Ingen manuell hantering krävs
Kostnadsoptimerade
för produktionsarbetsbelastningar
$$
När använder du vilket?
$$
Vanligt misstag:
att köra produktionspipelines på all-purpose-kluster
Databricks Runtime
$$
Versionshanterad programvarustack
som körs på varje kluster
Inkluderar Apache Spark, Delta Lake, Python, R, Scala
LTS
-versioner – långtidssupport, rekommenderas för produktion
ML Runtime
lägger till förinstallerade ML-bibliotek
$$
Sammanfattning
$$
All-purpose-kluster
– interaktiva, delade, manuellt hanterade
Jobbkluster
– automatiserade, enskild uppgift, kostnadsoptimerade
Databricks Runtime
– versionshanterad programvarustack (använd LTS för produktion)
Matcha klustertypen med arbetsbelastningen för att hålla kostnaderna nere
Nu kör vi en övning!
Introduktion till Databricks Lakehouse
Preparing Video For Download...