Types de clusters et runtimes

Introduction à Databricks Lakehouse

Gang Wang

Senior Data Scientist

Qu'est-ce qu'un cluster ?

$$

  • Un ensemble de machines virtuelles exécute votre code
  • Un nœud driver coordonne le travail
  • Un ou plusieurs nœuds worker traitent les données
  • Les clusters lisent les données depuis le stockage cloud

$$

$$

hiérarchie : nœud Driver, Worker 1, Worker 2, Worker 3, stockage cloud

Introduction à Databricks Lakehouse

Clusters polyvalents

$$

  • Développement interactif et requêtes ad hoc
  • Partagé entre plusieurs utilisateurs d'une équipe
  • Reste actif jusqu'à arrêt manuel
  • Pensez à une voiture personnelle : toujours dispo, mais vous payez même à l'arrêt

$$

recraft: half: Une voiture personnelle garée dans une allée, toujours disponible mais coûte de l'argent même à l'arrêt, représentant une ressource de calcul toujours allumée

Introduction à Databricks Lakehouse

Clusters de jobs

$$

  • Créés automatiquement au démarrage d'un job
  • Exécutent une seule tâche, puis se terminent
  • Aucune gestion manuelle requise
  • Optimisés en coût pour la production

$$

recraft: half: Un taxi moderne avec un compteur lumineux sur le toit, représentant une ressource de calcul à la demande qui s'exécute et s'arrête automatiquement

Introduction à Databricks Lakehouse

Quel type utiliser ?

$$

comparaison : Polyvalents, Dev interactif, Travail en notebook, SQL ad hoc, Partage d'équipe | Jobs, ETL nocturne, Rapports planifiés, Tests auto, Production

  • Erreur fréquente : exécuter des pipelines de production sur des clusters polyvalents
Introduction à Databricks Lakehouse

Databricks Runtime

$$

  • Pile logicielle versionnée exécutée sur chaque cluster
  • Inclut Apache Spark, Delta Lake, Python, R, Scala
  • Versions LTS : support long terme, recommandé pour la production
  • ML Runtime ajoute des bibliothèques ML préinstallées

$$

couches : Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Bibliothèques système

Introduction à Databricks Lakehouse

Résumé

$$

  • Clusters polyvalents : interactifs, partagés, gérés manuellement
  • Clusters de jobs : automatisés, mono‑tâche, optimisés en coût
  • Databricks Runtime : pile logicielle versionnée (utilisez LTS en production)
  • Adaptez le type de cluster à la charge pour maîtriser les coûts
Introduction à Databricks Lakehouse

Passons à la pratique !

Introduction à Databricks Lakehouse

Preparing Video For Download...