Mettere tutto insieme

Introduzione a Databricks Lakehouse

Gang Wang

Senior Data Scientist

Lo scenario

$$

  • Sei un data engineer che avvia un nuovo progetto in un'azienda retail
  • Obiettivo: configurare il compute, verificare la pipeline dati, controllare la governance e preparare il deploy

$$

recraft: half: Un data engineer a una scrivania moderna con un laptop che mostra un'interfaccia in stile Databricks, con diagrammi di pipeline su una lavagna alle spalle, a rappresentare l'onboarding a un nuovo progetto dati

Introduzione a Databricks Lakehouse

Passo 1: Scegli il compute giusto

$$

  • La pipeline gira ogni notte secondo pianificazione
  • Nessuno sviluppo interattivo necessario
  • Un jobs cluster con runtime LTS è la scelta giusta
  • Imposta l'autoscaling (2–6 worker) per volumi variabili

$$

All-Purpose Jobs Cluster
Modality Interattivo Automatizzato
Gestione Manuale Auto-termina
Costo Più alto (idle) Ottimizzato sui costi
Introduzione a Databricks Lakehouse

Passo 2: Verifica la pipeline a medaglione

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: dati raw, conteggio più alto
  • Silver: puliti, rimossi null e duplicati
  • Gold: aggregati per reportistica business
  • Le righe calano man mano che cresce la qualità
Introduzione a Databricks Lakehouse

Passo 3: Controlla la governance

$$

  • Vai su Unity Catalog e ispeziona la tabella gold_daily_revenue
  • Traccia la lineage a monte per confermare la lettura da silver_sales
  • Verifica i controlli di accesso: solo il team analytics ha SELECT su gold
  • Conferma che Delta Sharing è configurato per il partner esterno

$$

recraft: half: Una lente d'ingrandimento sopra un grafo di lineage dei dati con nodi di tabelle collegati e segni di spunta, a rappresentare la verifica della governance

Introduzione a Databricks Lakehouse

Passo 4: Preparati al deploy

$$

  • Rivedi l'Asset Bundle databricks.yml
  • Conferma che la risorsa del job notturno è definita
  • Controlla che il target di produzione punti al percorso workspace corretto
  • Esegui bundle validate prima del deploy

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introduzione a Databricks Lakehouse

Riepilogo

$$

  • Compute: abbina il tipo di cluster al carico (jobs cluster per l'automazione)
  • Dati: verifica che i livelli del medaglione fluiscano correttamente
  • Governance: traccia la lineage, controlla accessi, conferma la condivisione
  • Deploy: rivedi l'Asset Bundle, valida, distribuisci
Introduzione a Databricks Lakehouse

Esercitiamoci!

Introduzione a Databricks Lakehouse

Preparing Video For Download...