Totul laolaltă

Introducere în Databricks Lakehouse

Gang Wang

Senior Data Scientist

Scenariul

$$

  • Ești un inginer de date care începe un proiect nou la o companie de retail
  • Obiectiv: configurezi resursele de calcul, verifici pipeline-ul de date, controlezi guvernanța și te pregătești pentru deployment

$$

recraft: half: Un inginer de date la un birou modern cu un laptop care afișează o interfață Databricks, cu diagrame de pipeline pe o tablă albă în fundal, reprezentând integrarea într-un nou proiect de date

Introducere în Databricks Lakehouse

Pasul 1: Alege resursele de calcul potrivite

$$

  • Pipeline-ul rulează nocturn, după un program
  • Nu este nevoie de dezvoltare interactivă
  • Un jobs cluster cu runtime LTS este alegerea potrivită
  • Configurează autoscaling (2–6 workeri) pentru volume variabile de date

$$

All-Purpose Jobs Cluster
Mod Interactiv Automatizat
Gestionare Manual Auto-terminare
Cost Mai mare (timp inactiv) Optimizat
Introducere în Databricks Lakehouse

Pasul 2: Verifică pipeline-ul medallion

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: date brute, număr maxim de înregistrări
  • Silver: date curățate, fără valori nule și duplicate
  • Gold: date agregate pentru raportare business
  • Numărul de înregistrări scade pe măsură ce calitatea crește
Introducere în Databricks Lakehouse

Pasul 3: Verifică guvernanța

$$

  • Navighează în Unity Catalog și inspectează tabela gold_daily_revenue
  • Urmărește lineage-ul upstream pentru a confirma că citește din silver_sales
  • Verifică controalele de acces – doar echipa de analiză are SELECT pe gold
  • Confirmă că Delta Sharing este configurat pentru partenerul extern

$$

recraft: half: O lupă deasupra unui graf de lineage al datelor cu noduri de tabele conectate și bifă, reprezentând verificarea guvernanței

Introducere în Databricks Lakehouse

Pasul 4: Pregătește deployment-ul

$$

  • Revizuiește Asset Bundle-ul databricks.yml
  • Confirmă că resursa job nocturn este definită
  • Verifică că ținta de producție indică calea corectă din workspace
  • Rulează bundle validate înainte de deployment

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introducere în Databricks Lakehouse

Rezumat

$$

  • Calcul: potrivește tipul de cluster cu workload-ul (jobs cluster pentru automatizare)
  • Date: verifică că straturile medallion funcționează corect
  • Guvernanță: urmărește lineage-ul, verifică accesul, confirmă partajarea
  • Deployment: revizuiește Asset Bundle-ul, validează, deploy
Introducere în Databricks Lakehouse

Hai să exersăm!

Introducere în Databricks Lakehouse

Preparing Video For Download...