Réunir tous les éléments

Introduction à Databricks Lakehouse

Gang Wang

Senior Data Scientist

Le scénario

$$

  • Vous êtes data engineer et démarrez un nouveau projet dans une entreprise de retail
  • Objectif : configurer le calcul, vérifier le pipeline de données, contrôler la gouvernance et préparer le déploiement

$$

recraft: half: Un·e data engineer à un bureau moderne avec un ordinateur portable affichant une interface type Databricks, avec des schémas de pipeline sur un tableau blanc derrière, représentant l'onboarding sur un nouveau projet data

Introduction à Databricks Lakehouse

Étape 1 : Choisir le bon calcul

$$

  • Le pipeline s'exécute chaque nuit selon un planning
  • Pas de développement interactif nécessaire
  • Un cluster de jobs avec runtime LTS est le bon choix
  • Activez l'autoscaling (2–6 workers) pour un volume variable

$$

Polyvalent Cluster de jobs
Mode Interactif Automatisé
Gestion Manuelle Arrêt automatique
Coût Plus élevé (inactivité) Optimisé coût
Introduction à Databricks Lakehouse

Étape 2 : Vérifier la pipeline « medallion »

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze : données brutes, nombre de lignes maximal
  • Silver : nettoyées, null et doublons supprimés
  • Gold : agrégées pour le reporting métier
  • Le nombre de lignes baisse à mesure que la qualité augmente
Introduction à Databricks Lakehouse

Étape 3 : Contrôler la gouvernance

$$

  • Allez dans Unity Catalog et inspectez la table gold_daily_revenue
  • Suivez la lignée en amont pour confirmer la lecture depuis silver_sales
  • Vérifiez les contrôles d'accès : seule l'équipe analytics a SELECT sur gold
  • Confirmez que Delta Sharing est configuré pour le partenaire externe

$$

recraft: half: Une loupe sur un graphe de lignée de données montrant des nœuds de tables connectés avec des coches, représentant la vérification de la gouvernance

Introduction à Databricks Lakehouse

Étape 4 : Préparer le déploiement

$$

  • Passez en revue l'Asset Bundle databricks.yml
  • Confirmez que la ressource de job nocturne est définie
  • Vérifiez que la cible production pointe vers le bon chemin d'espace de travail
  • Exécutez bundle validate avant le déploiement

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introduction à Databricks Lakehouse

Résumé

$$

  • Calcul : adaptez le type de cluster à la charge (cluster de jobs pour l'automatisation)
  • Données : vérifiez le flux correct des couches medallion
  • Gouvernance : suivez la lignée, contrôlez l'accès, confirmez le partage
  • Déploiement : révisez l'Asset Bundle, validez, déployez
Introduction à Databricks Lakehouse

Passons à la pratique !

Introduction à Databricks Lakehouse

Preparing Video For Download...