Gestion des coûts
Concepts de LLMOps
Max Knobbout, PhD
Applied Scientist, Uber
Cycle de vie LLM : Gestion des coûts
Gestion des coûts
- Accent sur les coûts du modèle
- Les coûts augmentent selon hébergement et/ou utilisation
- Pour modèles auto-hébergés, coûts issus d’hébergement
- Pour modèles hébergés en externe, coûts issus d’utilisation
Décomposer les coûts des LLM
Auto-hébergé (open source)
- Cloud :
- Durée pendant laquelle serveur reste opérationnel
- Sur site :
- Coûts du matériel
- Maintenance et électricité
Hébergé en externe (propriétaire)
- Propriétaire :
- Nombre d'appels
- Nombre de jetons par appel
Stratégie 1 : Choisir le bon modèle
- Utiliser modèle le plus rentable pour la tâche
- Utiliser plusieurs petits modèles spécifiques à une tâche
- Pour auto-hébergement, envisager techniques de réduction taille modèle
Stratégie 2 : Optimiser les prompts
- Utiliser compression de prompt automatique
- Réduction de contenu :
- Optimiser gestion "mémoire de chat"
- Optimiser RAG pour réduire résultats
Stratégie 3 : Optimiser le nombre d'appels
- Utiliser batching
- Utiliser mise en cache réponses (si applicable)
- Optimiser (et limiter) appels d’agent
- Définir quotas et limites débit
- Considérer tâches ne nécessitant pas LLM
Métriques de coût et prévisions
- Important de suivre :
- Pour auto-hébergé, coût par machine par unité temps
- Pour hébergé en externe, coût par session
- Comprendre comment base d’utilisateurs grandit, entraînant évolution des coûts
Passons à la pratique !
Concepts de LLMOps
Preparing Video For Download...