Alles samenbrengen

Introductie tot Databricks Lakehouse

Gang Wang

Senior Data Scientist

Het scenario

$$

  • Je bent data engineer en start een nieuw project bij een retailbedrijf
  • Doel: compute instellen, de datapijplijn verifiëren, governance checken en klaarzetten voor deployment

$$

recraft: half: Een data engineer aan een moderne desk met een laptop met een Databricks-achtige interface, met pijplijndiagrammen op een whiteboard erachter, als symbool voor onboarding op een nieuw dataproject

Introductie tot Databricks Lakehouse

Stap 1: Kies de juiste compute

$$

  • De pijplijn draait nachtelijk volgens een schema
  • Geen interactieve ontwikkeling nodig
  • Een jobs-cluster met LTS-runtime is de juiste keuze
  • Zet autoscaling (2–6 workers) voor variabele datavolumes

$$

All-Purpose Jobs-cluster
Modus Interactief Geautomatiseerd
Beheer Handmatig Stopt automatisch
Kosten Hoger (wachttijd) Kosten-geoptimaliseerd
Introductie tot Databricks Lakehouse

Stap 2: Verifieer de medaillonpijplijn

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: ruwe data, hoogste rijen-aantal
  • Silver: opgeschoond, nulls en duplicaten verwijderd
  • Gold: geaggregeerd voor bedrijfsrapportage
  • Rijenaantallen dalen terwijl de kwaliteit stijgt
Introductie tot Databricks Lakehouse

Stap 3: Controleer governance

$$

  • Ga naar Unity Catalog en bekijk de tabel gold_daily_revenue
  • Volg lineage upstream om te bevestigen dat deze leest van silver_sales
  • Controleer toegangsrechten — alleen het analytics-team heeft SELECT op gold
  • Bevestig dat Delta Sharing is geconfigureerd voor de externe partner

$$

recraft: half: Een vergrootglas boven een data-lineagegrafiek met verbonden tabelknooppunten met vinkjes, als symbool voor governancecontrole

Introductie tot Databricks Lakehouse

Stap 4: Voorbereiden op deployment

$$

  • Review de databricks.yml Asset Bundle
  • Bevestig dat de nachtelijke jobresource is gedefinieerd
  • Check dat de production target naar het juiste workspacepad wijst
  • Run bundle validate vóór deployment

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introductie tot Databricks Lakehouse

Samenvatting

$$

  • Compute: koppel clustertype aan workload (jobs-cluster voor automatisering)
  • Data: verifieer dat medaillonlagen goed doorstromen
  • Governance: traceer lineage, check toegang, bevestig sharing
  • Deployment: review de Asset Bundle, valideer, deploy
Introductie tot Databricks Lakehouse

Laten we oefenen!

Introductie tot Databricks Lakehouse

Preparing Video For Download...