Types de clusters et runtimes
Introduction à Databricks Lakehouse
Gang Wang
Senior Data Scientist
Qu'est-ce qu'un cluster ?
$$
Un
ensemble de machines virtuelles
exécute votre code
Un nœud
driver
coordonne le travail
Un ou plusieurs nœuds
worker
traitent les données
Les clusters lisent les données depuis le stockage cloud
$$
$$
Clusters polyvalents
$$
Développement
interactif
et requêtes ad hoc
Partagé
entre plusieurs utilisateurs d'une équipe
Reste actif jusqu'à
arrêt manuel
Pensez à une voiture personnelle : toujours dispo, mais vous payez même à l'arrêt
$$
Clusters de jobs
$$
Créés
automatiquement
au démarrage d'un job
Exécutent
une seule tâche
, puis se terminent
Aucune gestion manuelle requise
Optimisés en coût
pour la production
$$
Quel type utiliser ?
$$
Erreur fréquente :
exécuter des pipelines de production sur des clusters polyvalents
Databricks Runtime
$$
Pile logicielle versionnée
exécutée sur chaque cluster
Inclut Apache Spark, Delta Lake, Python, R, Scala
Versions
LTS
: support long terme, recommandé pour la production
ML Runtime
ajoute des bibliothèques ML préinstallées
$$
Résumé
$$
Clusters polyvalents
: interactifs, partagés, gérés manuellement
Clusters de jobs
: automatisés, mono‑tâche, optimisés en coût
Databricks Runtime
: pile logicielle versionnée (utilisez LTS en production)
Adaptez le type de cluster à la charge pour maîtriser les coûts
Passons à la pratique !
Introduction à Databricks Lakehouse
Preparing Video For Download...