Typy klastrów i środowiska uruchomieniowe

Wprowadzenie do Databricks Lakehouse

Gang Wang

Senior Data Scientist

Czym jest klaster?

$$

  • Zbiór maszyn wirtualnych uruchamiających twój kod
  • Jeden węzeł sterownika koordynuje pracę
  • Jeden lub więcej węzłów roboczych przetwarza dane
  • Klastry odczytują dane z pamięci masowej w chmurze

$$

$$

hierarchia: węzeł sterownika, Worker 1, Worker 2, Worker 3, Cloud Storage

Wprowadzenie do Databricks Lakehouse

Klastry ogólnego przeznaczenia

$$

  • Interaktywne tworzenie kodu i doraźne zapytania
  • Współdzielone przez wielu użytkowników w zespole
  • Działają do ręcznego zatrzymania
  • Jak prywatny samochód — zawsze pod ręką, ale płacisz, nawet gdy stoi

$$

recraft: half: A personal car parked in a driveway, always available but costs money even when idle, representing an always-on compute resource

Wprowadzenie do Databricks Lakehouse

Klastry zadań

$$

  • Tworzone automatycznie po uruchomieniu zadania
  • Wykonują jedno zadanie, a następnie kończą działanie
  • Nie wymagają ręcznego zarządzania
  • Zoptymalizowane kosztowo pod kątem środowisk produkcyjnych

$$

recraft: half: A modern taxi cab with a glowing meter on top, representing an on-demand compute resource that runs and stops automatically

Wprowadzenie do Databricks Lakehouse

Kiedy używać którego?

$$

comparison: All-Purpose, Interactive dev, Notebook work, Ad-hoc SQL, Team sharing | Jobs, Nightly ETL, Scheduled reports, Auto testing, Production

  • Częsty błąd: uruchamianie potoków produkcyjnych na klastrach ogólnego przeznaczenia
Wprowadzenie do Databricks Lakehouse

Databricks Runtime

$$

  • Wersjonowany stos oprogramowania działający na każdym klastrze
  • Obejmuje Apache Spark, Delta Lake, Python, R i Scala
  • Wersje LTS — długoterminowe wsparcie, zalecane na produkcję
  • ML Runtime dodaje preinstalowane biblioteki ML

$$

warstwy: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, biblioteki systemowe

Wprowadzenie do Databricks Lakehouse

Podsumowanie

$$

  • Klastry ogólnego przeznaczenia — interaktywne, współdzielone, zarządzane ręcznie
  • Klastry zadań — zautomatyzowane, jednorazowe, zoptymalizowane kosztowo
  • Databricks Runtime — wersjonowany stos oprogramowania (na produkcję używaj LTS)
  • Dobieraj typ klastra do obciążenia, aby kontrolować koszty
Wprowadzenie do Databricks Lakehouse

Czas na praktykę!

Wprowadzenie do Databricks Lakehouse

Preparing Video For Download...