Övervakning och larm

MLOps-driftsättning och livscykelhantering

Nemanja Radojkovic

Senior Machine Learning Engineer

omvärlden

MLOps-driftsättning och livscykelhantering

buggar i tjänsten

MLOps-driftsättning och livscykelhantering

fånga buggar

MLOps-driftsättning och livscykelhantering

många rörliga delar

MLOps-driftsättning och livscykelhantering

felpunkter 2

MLOps-driftsättning och livscykelhantering

larm

MLOps-driftsättning och livscykelhantering

titta här

MLOps-driftsättning och livscykelhantering

loggning 1

MLOps-driftsättning och livscykelhantering

loggning 2

MLOps-driftsättning och livscykelhantering

loggning 3

MLOps-driftsättning och livscykelhantering

datapipeline 1

MLOps-driftsättning och livscykelhantering

datavalidering 2

MLOps-driftsättning och livscykelhantering

dataprofilsvalidering

MLOps-driftsättning och livscykelhantering

Statistisk validering

Kan vara:

  • för känslig
  • inte tillräckligt informativ

 

Risk

  • För många larm
  • "Larmtrötthet"
  • Viktiga larm missas
MLOps-driftsättning och livscykelhantering

informera alla

MLOps-driftsättning och livscykelhantering

Lär av historiken

Efter att incidenten hanterats => Dokumentera grundorsak och åtgärdssteg

Exempel från Google[1]:

  • 10 års incidenter registrerade och analyserade
  • > 2/3 var inte ML-relaterade!
1 How ML Breaks: A Decade of Outages for One Large ML Pipeline, https://www.usenix.org/conference/opml20/presentation/papasian
MLOps-driftsättning och livscykelhantering

centraliserad övervakning

MLOps-driftsättning och livscykelhantering

Nu kör vi en övning!

MLOps-driftsättning och livscykelhantering

Preparing Video For Download...