Gestion des coûts
Concepts de LLMOps
Max Knobbout, PhD
Applied Scientist, Uber
Cycle de vie des LLM : gestion des coûts
Gestion des coûts
- L'accent est mis sur les coûts du modèle
- Les coûts peuvent grimper selon l'hébergement et/ou l'usage
- Modèles auto-hébergés : coûts d'hébergement
- Modèles hébergés à l'externe : coûts d'usage
Ventilation des coûts des LLM
Self-hosted (open source)
- Cloud:
- Duration the server remains operational
- On-premise:
- Hardware costs
- Maintenance and electricity
Hébergé à l'externe (propriétaire)
- Propriétaire :
- Nombre d'appels
- Nombre de jetons par appel
Stratégie 1 : choisir le bon modèle
- Choisir le modèle le plus économique qui fait le travail
- Utiliser plusieurs petits modèles spécifiques à la tâche
- En auto-hébergement, envisager des techniques de réduction de taille
Stratégie 2 : optimiser les requêtes
- Utiliser la compression de requêtes automatique
- Réduction de contenu :
- Optimiser la gestion de la « mémoire de clavardage »
- Optimiser le RAG pour renvoyer moins de résultats
Stratégie 3 : optimiser le nombre d'appels
- Utiliser le traitement par lots
- Utiliser la mise en cache des réponses (au besoin)
- Optimiser (et limiter) les appels d'agents
- Définir des quotas et des limites de débit
- Envisager des tâches sans LLM
Mesures de coûts et prévision
- Important à suivre :
- Auto-hébergé : coût par machine et par unité de temps
- Hébergé à l'externe : coût par session
- Comprendre la croissance de la base d'utilisateurs et l'évolution des coûts en parallèle
Passons à la pratique !
Concepts de LLMOps
Preparing Video For Download...