Alles zusammenführen

Einführung in das Databricks Lakehouse

Gang Wang

Senior Data Scientist

Das Szenario

$$

  • Du bist Data Engineer:in und startest ein neues Projekt bei einem Einzelhändler
  • Ziel: Compute einrichten, Pipeline prüfen, Governance checken und den Rollout vorbereiten

$$

recraft: half: Ein Data Engineer an einem modernen Schreibtisch mit Laptop und Databricks-ähnlicher Oberfläche; auf dem Whiteboard dahinter Pipeline-Diagramme – symbolisiert das Onboarding in ein neues Datenprojekt

Einführung in das Databricks Lakehouse

Schritt 1: Passende Compute wählen

$$

  • Die Pipeline läuft nächtlich nach Zeitplan
  • Kein interaktives Development nötig
  • Ein Jobs-Cluster mit LTS-Runtime ist passend
  • Autoscaling setzen (2–6 Worker) für variable Datenmengen

$$

All-Purpose Jobs-Cluster
Modus Interaktiv Automatisiert
Verwaltung Manuell Beendet automatisch
Kosten Höher (Leerlauf) Kostenoptimiert
Einführung in das Databricks Lakehouse

Schritt 2: Medaillon-Pipeline prüfen

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: roh, höchste Zeilenanzahl
  • Silver: bereinigt, Nulls und Duplikate entfernt
  • Gold: aggregiert für Business-Reporting
  • Zeilenzahlen sinken, während die Qualität steigt
Einführung in das Databricks Lakehouse

Schritt 3: Governance prüfen

$$

  • Gehe in den Unity Catalog und inspiziere die Tabelle gold_daily_revenue
  • Verfolge die Lineage nach oben und bestätige, dass aus silver_sales gelesen wird
  • Prüfe Zugriffsrechte – nur das Analytics-Team hat SELECT auf Gold
  • Bestätige, dass Delta Sharing für den externen Partner konfiguriert ist

$$

recraft: half: Eine Lupe über einem Data-Lineage-Graphen mit verbundenen Tabellennodes und Häkchen – steht für Governance-Prüfung

Einführung in das Databricks Lakehouse

Schritt 4: Für den Rollout vorbereiten

$$

  • Prüfe das databricks.yml Asset Bundle
  • Bestätige, dass der nächtliche Job als Ressource definiert ist
  • Checke, dass das Production-Target auf den richtigen Workspace-Pfad zeigt
  • Führe vor dem Deploy bundle validate aus

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Einführung in das Databricks Lakehouse

Zusammenfassung

$$

  • Compute: Clustertyp zur Workload passend wählen (Jobs-Cluster für Automation)
  • Daten: prüfen, ob die Medaillon-Layer korrekt fließen
  • Governance: Lineage verfolgen, Zugriff prüfen, Sharing bestätigen
  • Deployment: Asset Bundle prüfen, validieren, deployen
Einführung in das Databricks Lakehouse

Lass uns üben!

Einführung in das Databricks Lakehouse

Preparing Video For Download...