Surveillance et observabilité
Concepts de LLMOps
Max Knobbout, PhD
Applied Scientist, Uber
Cycle de vie LLM : surveillance et observabilité
Surveillance et observabilité
Surveillance
: suivi continu d'un système.
Observabilité
: exposition des états internes aux observateurs externes.
Sources de données pour l'observabilité :
Journaux (logs)
Mesures (métriques)
Traces
Surveillance des entrées
Surveiller les entrées pour :
Changements
Erreurs
Contenu malveillant
Dérive des données : changement de la distribution des entrées dans le temps
Pour y répondre :
Suivre la distribution des données
Mettre le modèle à jour périodiquement
Surveillance fonctionnelle
Exemples :
Temps de réponse
Volume de requêtes
Pannes (temps d'arrêt)
Taux d'erreur
Pour les applications LLM :
Exécution des chaînes et des agents
Ressources système (GPU)
Coûts
Surveillance des sorties
Utiliser les métriques définies aux tests, p. ex. :
Biais
Toxicité
Utilité
Dérive du modèle :
Le lien entre entrée et sortie change
Le filtrage implique une intervention active
Gestion des alertes
Être avisé dès qu'un problème survient
Disposer de procédures claires
Des ententes de niveau de service (SLA) peuvent s'appliquer
Passons à la pratique !
Concepts de LLMOps
Preparing Video For Download...