Allt på en gång

Introduktion till Databricks Lakehouse

Gang Wang

Senior Data Scientist

Scenariot

$$

  • Du är en dataingenjör som startar ett nytt projekt på ett detaljhandelsföretag
  • Mål: konfigurera beräkning, verifiera datapipelinen, kontrollera styrning och förbered för driftsättning

$$

recraft: half: En dataingenjör vid ett modernt skrivbord med en laptop som visar ett Databricks-liknande gränssnitt, med pipelinediagram på en whiteboard i bakgrunden, som representerar onboarding till ett nytt dataprojekt

Introduktion till Databricks Lakehouse

Steg 1: Välj rätt beräkningsresurs

$$

  • Pipelinen körs nattligen enligt schema
  • Ingen interaktiv utveckling behövs
  • Ett jobs-kluster med LTS-runtime är rätt val
  • Ange autoskalning (2–6 workers) för varierande datavolym

$$

All-Purpose Jobs Cluster
Läge Interaktivt Automatiserat
Hantering Manuell Avslutas automatiskt
Kostnad Högre (inaktiv tid) Kostnadsoptimerat
Introduktion till Databricks Lakehouse

Steg 2: Verifiera medallion-pipelinen

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: rådata, högst radantal
  • Silver: rensad, null-värden och dubbletter borttagna
  • Gold: aggregerad för affärsrapportering
  • Radantalet minskar i takt med att kvaliteten ökar
Introduktion till Databricks Lakehouse

Steg 3: Kontrollera styrning

$$

  • Navigera till Unity Catalog och granska tabellen gold_daily_revenue
  • Spåra ursprung uppströms för att bekräfta att den läser från silver_sales
  • Verifiera åtkomstkontroller – endast analysteamet har SELECT på gold
  • Bekräfta att Delta Sharing är konfigurerat för den externa partnern

$$

recraft: half: Ett förstoringsglas som håller över en datalinjegraf med sammankopplade tabellnoder och bockar, som representerar verifiering av styrning

Introduktion till Databricks Lakehouse

Steg 4: Förbered för driftsättning

$$

  • Granska databricks.yml Asset Bundle
  • Bekräfta att det nattliga jobbets resurs är definierad
  • Kontrollera att produktionsmålet pekar på rätt workspace-sökväg
  • Kör bundle validate innan driftsättning

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introduktion till Databricks Lakehouse

Sammanfattning

$$

  • Beräkning: matcha klustertyp med arbetsbelastning (jobs-kluster för automatisering)
  • Data: verifiera att medallion-lagren flödar korrekt
  • Styrning: spåra ursprung, kontrollera åtkomst, bekräfta delning
  • Driftsättning: granska Asset Bundle, validera, driftsätt
Introduktion till Databricks Lakehouse

Nu kör vi en övning!

Introduktion till Databricks Lakehouse

Preparing Video For Download...