Phương pháp thu thập phản hồi chất lượng cao

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Phương pháp thu thập phản hồi chất lượng cao

Quy trình RLHF, không có mô hình phần thưởng.

Reinforcement Learning from Human Feedback (RLHF)

Phương pháp thu thập phản hồi chất lượng cao

Quy trình RLHF đầy đủ.

Reinforcement Learning from Human Feedback (RLHF)

So sánh cặp đôi

  • Chọn giữa hai phương án:
  • Ưu điểm: Đơn giản, trực quan, giảm thiên lệch
  • Thách thức: Ít thông tin trên mỗi nhãn
  • Ví dụ: Phim A vs. Phim B: "Bạn thích cái nào hơn?"

Một người cầm hai tấm bảng: một có biểu tượng "Chấp nhận" và một có biểu tượng "Từ chối".

Reinforcement Learning from Human Feedback (RLHF)

So sánh cặp đôi

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

Xếp hạng

  • Chấm điểm theo thang:

  • Ưu điểm: Phản hồi chi tiết hơn

  • Thách thức: Dễ thiên lệch, thang đo không nhất quán
  • Ví dụ:
      Phim A: 4/5
      Phim B: 3/5
    

Minh họa một phụ nữ cầm ngôi sao với các biểu tượng xếp hạng xung quanh.

Reinforcement Learning from Human Feedback (RLHF)

Yếu tố tâm lý

  • Thiên lệch nhận thức:
    • Hiệu ứng khung: Cách trình bày câu hỏi ảnh hưởng câu trả lời
    • Hiệu ứng vị trí tuần tự: Thứ tự trình bày lựa chọn ảnh hưởng quyết định
    • Neo: Thông tin trước đó làm lệch quyết định hiện tại

Một người nhìn thấy hình vuông bằng mắt nhưng diễn giải thành hình chữ nhật trong đầu, minh họa khái niệm thiên lệch.

Reinforcement Learning from Human Feedback (RLHF)

Hướng dẫn thu thập phản hồi chất lượng cao

 

  • Tải nhận thức: người dùng mệt mỏi, phản hồi thiếu nhất quán
  • Diễn đạt câu hỏi cẩn thận
    • Giảm rủi ro do tải nhận thức.
  • Xáo trộn thứ tự câu hỏi
    • Giảm thiên lệch do neo và khung.
  • Thu thập dữ liệu đa dạng
    • Giảm nhiễu.

Ảnh một nam và một nữ phân tích phản hồi và văn bản.

Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...