고품질 피드백 수집 방법

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

고품질 피드백 수집 방법

보상 모델을 제외한 RLHF 프로세스.

Reinforcement Learning from Human Feedback (RLHF)

고품질 피드백 수집 방법

전체 RLHF 프로세스.

Reinforcement Learning from Human Feedback (RLHF)

쌍대 비교

  • 두 옵션 중 선택:
  • 장점: 간단, 직관적, 편향 감소
  • 과제: 레이블당 정보량 적음
  • 예시: 영화 A vs. 영화 B: "어느 쪽이 더 낫습니까?"

양손에 ‘승인’ 아이콘과 ‘거부’ 아이콘 표지를 든 사람.

Reinforcement Learning from Human Feedback (RLHF)

쌍대 비교

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

평점(Ratings)

  • 척도에 점수 부여:

  • 장점: 더 구체적인 피드백 제공

  • 과제: 편향, 일관되지 않은 척도
  • 예시:
      영화 A: 4/5
      영화 B: 3/5
    

별을 들고 있으며 주변에 평점을 나타내는 아이콘이 있는 여성의 일러스트.

Reinforcement Learning from Human Feedback (RLHF)

심리적 요인

  • 인지 편향:
    • 프레이밍 효과: 질문 제시 방식이 응답에 영향
    • 계열 위치 효과: 제시 순서가 선택에 영향
    • 앵커링: 이전 정보가 현재 결정에 편향 유발

눈으로는 정사각형을 보지만 마음속에서는 직사각형으로 해석하는 사람의 그림으로, 편향 개념을 나타냄.

Reinforcement Learning from Human Feedback (RLHF)

고품질 피드백 수집 가이드라인

 

  • 인지 부하: 피로한 사용자, 불일치한 피드백
  • 질문을 신중히 표현
    • 인지 부하로 인한 위험 감소
  • 질문 순서 무작위화
    • 앵커링·프레이밍 편향 최소화
  • 다양한 데이터 수집
    • 노이즈 문제 완화

피드백과 텍스트를 분석하는 남성과 여성의 사진.

Reinforcement Learning from Human Feedback (RLHF)

연습해 봅시다!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...