Hantera och konfigurera kluster

Introduktion till Databricks Lakehouse

Gang Wang

Senior Data Scientist

Hitta dina kluster

$$

  • All Clusters – allt i arbetsytan
  • My Clusters – kluster du har skapat
  • Shared with Me – kluster andra gett dig åtkomst till
  • Filtrera efter status: Running, Terminated

$$

recraft: half: A filing cabinet with color-coded folders and labels showing organized categories, representing cluster filtering and organization

Introduktion till Databricks Lakehouse

Klusterstatus

flowchart: Pending, Running, Restarting, Terminating, Terminated

Introduktion till Databricks Lakehouse

Terminering: vad som bevaras och vad som försvinner

comparison: Preserved, Configuration, Notebooks, Cloud storage | Lost, In-memory data, Installed libraries, Temp files

  • Terminering är inte radering – konfiguration och notebooks bevaras
  • Data i minnet, cacheminnen och pip-installerade paket rensas
Introduktion till Databricks Lakehouse

När du bör starta om

$$

  • Installerat ett nytt bibliotek som inte läses in
  • Klustret beter sig instabilt eller är långsamt
  • Behöver rensa cachad data från minnet
  • Uppdaterat ett init-skript eller en miljövariabel

$$

recraft: half: A power button icon with circular arrows around it glowing in blue and green, representing a system restart or refresh operation

Introduktion till Databricks Lakehouse

Autoskalning och automatisk terminering

$$

Autoscaling and Auto-termination

$$

  • Autoskalning lägger till eller tar bort arbetarnoder efter behov
  • Hanterar ojämna arbetsbelastningar utan överprovisionering
  • Automatisk terminering stänger av klustret efter en inaktiv period
  • Förhindrar att glömda kluster förbrukar budget
Introduktion till Databricks Lakehouse

Klusterpolicyer

$$

  • Admindefinierade begränsningar för klusterskapande
  • Begränsar nodtyper, maximalt antal arbetarnoder och körtidsversioner
  • Tvingar fram automatisk terminering och taggning
  • Användare skapar kluster inom policyns gränser

$$

{
  "max_workers": 8,
  "auto_termination_minutes": 30,
  "allowed_node_types": [
    "Standard_DS3_v2",
    "Standard_DS4_v2"
  ]
}
Introduktion till Databricks Lakehouse

Sammanfattning

$$

  • Filtrera kluster för att snabbt hitta det du behöver
  • Terminering sparar kostnader men rensar minne och bibliotek
  • Starta om för att ladda nya bibliotek eller felsöka problem
  • Autoskalning och automatisk terminering styr kostnader automatiskt
  • Klusterpolicyer låter admins upprätthålla standarder
Introduktion till Databricks Lakehouse

Nu kör vi en övning!

Introduktion till Databricks Lakehouse

Preparing Video For Download...