Clusters beheren en configureren

Introductie tot Databricks Lakehouse

Gang Wang

Senior Data Scientist

Je clusters vinden

$$

  • All Clusters - alles in de werkruimte
  • My Clusters - clusters die je hebt gemaakt
  • Shared with Me - clusters waarvoor anderen je toegang gaven
  • Filter op status: Running, Terminated

$$

recraft: half: Een archiefkast met kleurgecodeerde mappen en labels die georganiseerde categorieën tonen, als metafoor voor filteren en organiseren van clusters

Introductie tot Databricks Lakehouse

Clusterstatussen

stroomschema: Pending, Running, Restarting, Terminating, Terminated

Introductie tot Databricks Lakehouse

Beëindigen: wat blijft en wat je kwijt bent

vergelijking: Behouden, Configuratie, Notebooks, Cloudopslag | Verloren, Gegevens in geheugen, Geïnstalleerde libraries, Tijdelijke bestanden

  • Beëindigen is niet verwijderen - config en notebooks blijven
  • Gegevens in geheugen, caches en via pip geïnstalleerde packages worden gewist
Introductie tot Databricks Lakehouse

Wanneer opnieuw starten

$$

  • Nieuwe library geïnstalleerd die niet laadt
  • Cluster gedraagt zich onvoorspelbaar of is traag
  • Cachegegevens in het geheugen wissen
  • Init-script of omgevingsvariabele bijgewerkt

$$

recraft: half: Een aan/uit-knop met cirkelvormige pijlen eromheen die blauw en groen gloeien, als symbool voor opnieuw starten of verversen

Introductie tot Databricks Lakehouse

Autoscaling en automatisch beëindigen

$$

Autoscaling en automatisch beëindigen

$$

  • Autoscaling voegt workers toe of verwijdert ze op basis van vraag
  • Verwerkt piekbelasting zonder overprovisioning
  • Auto-termination schakelt uit na een ingestelde idle-periode
  • Voorkomt dat vergeten clusters budget opsouperen
Introductie tot Databricks Lakehouse

Clusterbeleid

$$

  • Door admins ingestelde guardrails voor clusteraanmaak
  • Beperk knooptypen, max. aantal workers en runtimeversies
  • Dwing automatisch beëindigen en tagging af
  • Gebruikers maken clusters binnen de beleidsgrenzen

$$

{
  "max_workers": 8,
  "auto_termination_minutes": 30,
  "allowed_node_types": [
    "Standard_DS3_v2",
    "Standard_DS4_v2"
  ]
}
Introductie tot Databricks Lakehouse

Samenvatting

$$

  • Filter clusters om snel te vinden wat je nodig hebt
  • Beëindigen bespaart kosten maar wist geheugen en libraries
  • Opnieuw starten om nieuwe libraries te laden of te troubleshooten
  • Autoscaling en auto-termination beheren kosten automatisch
  • Clusterbeleid laat admins standaarden afdwingen
Introductie tot Databricks Lakehouse

Laten we oefenen!

Introductie tot Databricks Lakehouse

Preparing Video For Download...