Gestion et configuration des clusters

Introduction à Databricks Lakehouse

Gang Wang

Senior Data Scientist

Trouver vos clusters

$$

  • All Clusters : tout l'espace de travail
  • My Clusters : vos clusters créés
  • Shared with Me : accès partagés par d'autres
  • Filtrer par état : Running, Terminated

$$

recraft: half: Un classeur avec des dossiers codés par couleur et des étiquettes montrant des catégories organisées, représentant le filtrage et l'organisation des clusters

Introduction à Databricks Lakehouse

États d'un cluster

organigramme : Pending, Running, Restarting, Terminating, Terminated

Introduction à Databricks Lakehouse

Terminaison : ce qui est conservé ou perdu

comparaison : Conservé : Configuration, Notebooks, Stockage cloud | Perdu : Données en mémoire, Bibliothèques installées, Fichiers temporaires

  • La terminaison n'est pas une suppression : config et notebooks restent
  • Données en mémoire, caches et paquets installés via pip sont effacés
Introduction à Databricks Lakehouse

Quand redémarrer

$$

  • Nouvelle bibliothèque installée qui ne se charge pas
  • Comportement imprévisible ou lenteurs du cluster
  • Besoin de vider les données en cache en mémoire
  • Init script ou variable d'environnement mis à jour

$$

recraft: half: Une icône de bouton d'alimentation avec des flèches circulaires bleu et vert, représentant un redémarrage ou un rafraîchissement du système

Introduction à Databricks Lakehouse

Autoscaling et auto-termination

$$

Mise à l'échelle automatique et arrêt automatique

$$

  • Autoscaling ajoute/retire des workers selon la demande
  • Gère les pics sans surdimensionnement
  • Auto-termination arrête après une période d'inactivité
  • Évite que des clusters oubliés ne grèvent le budget
Introduction à Databricks Lakehouse

Politiques de cluster

$$

  • Garde-fous définis par l'admin pour la création de clusters
  • Limiter types de nœuds, nb max de workers et versions de runtime
  • Imposer l'auto-termination et le tagging
  • Les utilisateurs créent des clusters dans le périmètre de la politique

$$

{
  "max_workers": 8,
  "auto_termination_minutes": 30,
  "allowed_node_types": [
    "Standard_DS3_v2",
    "Standard_DS4_v2"
  ]
}
Introduction à Databricks Lakehouse

En résumé

$$

  • Filtrez les clusters pour trouver vite ce qu'il vous faut
  • Terminaison : réduit les coûts mais efface mémoire et bibliothèques
  • Redémarrez pour activer de nouvelles bibliothèques ou dépanner
  • Autoscaling et auto-termination maîtrisent les coûts automatiquement
  • Les politiques de cluster permettent aux admins d'appliquer des standards
Introduction à Databricks Lakehouse

Passons à la pratique !

Introduction à Databricks Lakehouse

Preparing Video For Download...