Wszystko razem

Wprowadzenie do Databricks Lakehouse

Gang Wang

Senior Data Scientist

Scenariusz

$$

  • Jesteś inżynierem danych rozpoczynającym nowy projekt w firmie handlowej
  • Cel: skonfigurować klaster, sprawdzić potok danych, zweryfikować zarządzanie i przygotować wdrożenie

$$

recraft: half: A data engineer at a modern desk with a laptop showing a Databricks-style interface, with pipeline diagrams on a whiteboard behind them, representing onboarding to a new data project

Wprowadzenie do Databricks Lakehouse

Krok 1: Wybierz odpowiedni klaster

$$

  • Potok działa nocą według harmonogramu
  • Interaktywne programowanie nie jest potrzebne
  • Klaster zadań z wersją LTS to właściwy wybór
  • Ustaw autoskalowanie (2–6 węzłów) dla zmiennego wolumenu danych

$$

Ogólnego przeznaczenia Klaster zadań
Tryb Interaktywny Automatyczny
Zarządzanie Ręczne Automatyczne zamykanie
Koszt Wyższy (czas bezczynności) Zoptymalizowany
Wprowadzenie do Databricks Lakehouse

Krok 2: Zweryfikuj potok medalionowy

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: dane surowe, najwyższa liczba wierszy
  • Silver: dane oczyszczone, usunięto wartości null i duplikaty
  • Gold: dane zagregowane na potrzeby raportowania biznesowego
  • Liczba wierszy maleje wraz ze wzrostem jakości danych
Wprowadzenie do Databricks Lakehouse

Krok 3: Sprawdź zarządzanie danymi

$$

  • Przejdź do Unity Catalog i sprawdź tabelę gold_daily_revenue
  • Prześledź rodowód danych wstecz, aby potwierdzić odczyt z silver_sales
  • Zweryfikuj kontrolę dostępu — tylko zespół analityczny ma uprawnienie SELECT do gold
  • Potwierdź, że Delta Sharing jest skonfigurowany dla partnera zewnętrznego

$$

recraft: half: A magnifying glass hovering over a data lineage graph showing connected table nodes with checkmarks, representing governance verification

Wprowadzenie do Databricks Lakehouse

Krok 4: Przygotuj wdrożenie

$$

  • Przejrzyj Asset Bundle databricks.yml
  • Upewnij się, że zasób nocnego zadania jest zdefiniowany
  • Sprawdź, czy środowisko produkcyjne wskazuje właściwą ścieżkę obszaru roboczego
  • Przed wdrożeniem uruchom bundle validate

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Wprowadzenie do Databricks Lakehouse

Podsumowanie

$$

  • Klaster: dopasuj typ do zadania (klaster zadań do automatyzacji)
  • Dane: sprawdź, czy warstwy medalionowe działają poprawnie
  • Zarządzanie: prześledź rodowód, zweryfikuj dostęp i udostępnianie
  • Wdrożenie: przejrzyj Asset Bundle, zwaliduj i wdróż
Wprowadzenie do Databricks Lakehouse

Czas na praktykę!

Wprowadzenie do Databricks Lakehouse

Preparing Video For Download...