Modes de service

Déploiement MLOps et cycle de vie

Nemanja Radojkovic

Senior Machine Learning Engineer

modèle comme logiciel

Déploiement MLOps et cycle de vie

point de vue de l'utilisateur

Déploiement MLOps et cycle de vie

service comme les autres

Déploiement MLOps et cycle de vie

service alimentaire

Déploiement MLOps et cycle de vie

service de modèle

Déploiement MLOps et cycle de vie

Service et mode de service

  • Offrir un service de prédiction = « model serving »
  • Mise en œuvre d'un type précis de service = mode de service

Choisissez avec soin !

Déploiement MLOps et cycle de vie

quand exécuter le service

Déploiement MLOps et cycle de vie

planifié

Déploiement MLOps et cycle de vie

sur demande

Déploiement MLOps et cycle de vie

prédiction par lot 1

Déploiement MLOps et cycle de vie

prédiction par lot 2

Déploiement MLOps et cycle de vie

définition du lot

Déploiement MLOps et cycle de vie

aussi appelée

Déploiement MLOps et cycle de vie

Prédiction par lot : rester simple

  • La prédiction par lot est la plus simple
  • Si le cas d'usage le permet, adoptez-la
  • Bon usage : générer des prévisions de ventes mensuelles
Déploiement MLOps et cycle de vie

prédiction sur demande 1

Déploiement MLOps et cycle de vie

synonymes de sur demande

Déploiement MLOps et cycle de vie

importance du délai sur demande

Déploiement MLOps et cycle de vie

terme technique

Déploiement MLOps et cycle de vie

temps de requête

Déploiement MLOps et cycle de vie

temps de réponse

Déploiement MLOps et cycle de vie

Latence acceptable

Qu'est-ce qui est acceptable ?

  • < 1 heure ?
  • < 1 minute ?
  • < 1 seconde ?
  • < 1 milliseconde ?
Déploiement MLOps et cycle de vie

Prédiction quasi en temps réel, alias traitement en flux

Latence acceptable ≈ X minutes

Aussi appelé traitement en flux (les requêtes et réponses forment des « flux de données »)

Déploiement MLOps et cycle de vie

Prédiction en temps réel

Latence acceptable < 1 s

Exemple :

  • Détection de fraude par carte de crédit
  • Une prédiction tardive est quasi inutile
Déploiement MLOps et cycle de vie

Quand la latence est prioritaire

  • Un modèle moins puissant mais plus rapide vaut mieux qu'un modèle plus puissant mais plus lent
  • Déployer les modèles sur l'appareil de l'utilisateur pour réduire la latence ⇒ « edge deployment »
    • Applis mobiles avec ML :
      • applis de navigation
      • déverrouillage par reconnaissance faciale
      • filtres d'images
Déploiement MLOps et cycle de vie

Passons à la pratique !

Déploiement MLOps et cycle de vie

Preparing Video For Download...