Zarządzanie kosztami
Koncepcje LLMOps
Max Knobbout, PhD
Applied Scientist, Uber
Cykl życia LLM: zarządzanie kosztami
Zarządzanie kosztami
- Nacisk na koszty modelu
- Koszty mogą rosnąć w zależności od hostingu i/lub użytkowania
- Modele self-hosted: koszty wynikają z hostingu
- Modele hostowane zewnętrznie: koszty wynikają z użytkowania
Podział kosztów LLM
Self-hosted (open source)
- Chmura:
- On-premise:
- Koszty sprzętu
- Konserwacja i energia elektryczna
Zewnętrzny hosting (własnościowy)
- Własnościowy:
- Liczba wywołań
- Liczba tokenów na wywołanie
Strategia 1: Wybór odpowiedniego modelu
- Wybór najbardziej opłacalnego modelu realizującego zadanie
- Użycie wielu mniejszych modeli dedykowanych zadaniom
- W przypadku self-hostingu – rozważenie technik redukcji rozmiaru modelu
Strategia 2: Optymalizacja promptów
- Automatyczna kompresja promptów
- Redukcja treści:
- Optymalizacja zarządzania „pamięcią czatu"
- Optymalizacja RAG w celu zwracania mniejszej liczby wyników
Strategia 3: Optymalizacja liczby wywołań
- Stosowanie grupowania (batching)
- Stosowanie buforowania odpowiedzi (jeśli dotyczy)
- Optymalizacja (i ograniczanie) wywołań agentów
- Ustawianie limitów i limitów szybkości
- Rozważenie zadań niewymagających LLM
Metryki kosztów i prognozowanie
- Ważne do śledzenia:
- Dla modeli self-hosted: koszt maszyny na jednostkę czasu
- Dla modeli hostowanych zewnętrznie: koszt na sesję
- Zrozumienie wzrostu bazy użytkowników i skalowania kosztów
Czas na ćwiczenia!
Koncepcje LLMOps
Preparing Video For Download...