การจัดการต้นทุน
แนวคิด LLMOps
Max Knobbout, PhD
Applied Scientist, Uber
วงจรชีวิต LLM: การจัดการต้นทุน
การจัดการต้นทุน
- เน้นที่ต้นทุนของโมเดล
- ต้นทุนเพิ่มขึ้นตามการโฮสต์และ/หรือการใช้งาน
- โมเดลที่โฮสต์เองมีต้นทุนจากการโฮสต์
- โมเดลที่โฮสต์ภายนอกมีต้นทุนจากการใช้งาน
วิเคราะห์ต้นทุน LLM
โฮสต์เอง (โอเพนซอร์ส)
- Cloud:
- ระยะเวลาที่เซิร์ฟเวอร์ทำงานอยู่
- On-premise:
- ต้นทุนฮาร์ดแวร์
- การบำรุงรักษาและค่าไฟ
โฮสต์ภายนอก (กรรมสิทธิ์)
- Proprietary:
- จำนวนการเรียกใช้
- จำนวน token ต่อการเรียกใช้
กลยุทธ์ที่ 1: เลือกโมเดลให้เหมาะสม
- เลือกโมเดลที่คุ้มค่าที่สุดที่ยังทำงานได้ตามต้องการ
- ใช้โมเดลขนาดเล็กหลายตัวที่เน้นงานเฉพาะด้าน
- สำหรับการโฮสต์เอง พิจารณาเทคนิคลดขนาดโมเดล
กลยุทธ์ที่ 2: ปรับ prompt ให้เหมาะสม
- ใช้การบีบอัด prompt อัตโนมัติ
- การลดเนื้อหา:
- จัดการ "chat memory" ให้มีประสิทธิภาพ
- ปรับ RAG ให้คืนผลลัพธ์น้อยลง
กลยุทธ์ที่ 3: ลดจำนวนการเรียกใช้
- ใช้การประมวลผลแบบกลุ่ม (batching)
- ใช้การแคช (caching) คำตอบ (ถ้าเหมาะสม)
- ปรับและจำกัดการเรียกใช้ agent
- กำหนด quota และ rate limit
- พิจารณางานที่ไม่จำเป็นต้องใช้ LLM
เมตริกต้นทุนและการพยากรณ์
- สิ่งสำคัญที่ต้องติดตาม:
- สำหรับโฮสต์เอง คือต้นทุนต่อเครื่องต่อหน่วยเวลา
- สำหรับโฮสต์ภายนอก คือต้นทุนต่อเซสชัน
- เข้าใจแนวโน้มการเติบโตของผู้ใช้ และคาดการณ์ต้นทุนที่จะเพิ่มตามมา
มาฝึกกันเถอะ!
แนวคิด LLMOps
Preparing Video For Download...