Clustertypen en runtimes
Introductie tot Databricks Lakehouse
Gang Wang
Senior Data Scientist
Wat is een cluster?
$$
Een
set virtuele machines
die je code draait
Eén
driver
-node coördineert het werk
Eén of meer
worker
-nodes doen de verwerking
Clusters lezen data uit cloudopslag
$$
$$
All-purpose clusters
$$
Interactieve
ontwikkeling en ad-hocqueries
Gedeeld
door meerdere teamleden
Blijven actief tot je ze
handmatig
stopt
Zie het als je eigen auto: altijd beschikbaar, maar je betaalt ook als hij stilstaat
$$
Jobs clusters
$$
Automatisch
aangemaakt bij start van een job
Draaien
één taak
en stoppen daarna
Geen handmatig beheer nodig
Kostengeoptimaliseerd
voor productie
$$
Wanneer gebruik je welke?
$$
Veelgemaakte fout:
productiepijplijnen op all-purpose clusters draaien
Databricks Runtime
$$
Versiegebonden softwarestack
die op elk cluster draait
Bevat Apache Spark, Delta Lake, Python, R, Scala
LTS
-versies: long-term support, aanbevolen voor productie
ML Runtime
voegt vooraf geïnstalleerde ML-bibliotheken toe
$$
Samenvatting
$$
All-purpose clusters
: interactief, gedeeld, handmatig beheerd
Jobs clusters
: geautomatiseerd, één taak, kostengeoptimaliseerd
Databricks Runtime
: versiegebonden softwarestack (gebruik LTS voor productie)
Kies het clustertype passend bij de workload om kosten te sturen
Laten we oefenen!
Introductie tot Databricks Lakehouse
Preparing Video For Download...