Typy klastrów i środowiska uruchomieniowe
Wprowadzenie do Databricks Lakehouse
Gang Wang
Senior Data Scientist
Czym jest klaster?
$$
Zbiór maszyn wirtualnych
uruchamiających twój kod
Jeden węzeł
sterownika
koordynuje pracę
Jeden lub więcej węzłów
roboczych
przetwarza dane
Klastry odczytują dane z pamięci masowej w chmurze
$$
$$
Klastry ogólnego przeznaczenia
$$
Interaktywne
tworzenie kodu i doraźne zapytania
Współdzielone
przez wielu użytkowników w zespole
Działają do
ręcznego
zatrzymania
Jak prywatny samochód — zawsze pod ręką, ale płacisz, nawet gdy stoi
$$
Klastry zadań
$$
Tworzone
automatycznie
po uruchomieniu zadania
Wykonują
jedno zadanie
, a następnie kończą działanie
Nie wymagają ręcznego zarządzania
Zoptymalizowane kosztowo
pod kątem środowisk produkcyjnych
$$
Kiedy używać którego?
$$
Częsty błąd:
uruchamianie potoków produkcyjnych na klastrach ogólnego przeznaczenia
Databricks Runtime
$$
Wersjonowany stos oprogramowania
działający na każdym klastrze
Obejmuje Apache Spark, Delta Lake, Python, R i Scala
Wersje
LTS
— długoterminowe wsparcie, zalecane na produkcję
ML Runtime
dodaje preinstalowane biblioteki ML
$$
Podsumowanie
$$
Klastry ogólnego przeznaczenia
— interaktywne, współdzielone, zarządzane ręcznie
Klastry zadań
— zautomatyzowane, jednorazowe, zoptymalizowane kosztowo
Databricks Runtime
— wersjonowany stos oprogramowania (na produkcję używaj LTS)
Dobieraj typ klastra do obciążenia, aby kontrolować koszty
Czas na praktykę!
Wprowadzenie do Databricks Lakehouse
Preparing Video For Download...