다양한 피드백 출처 통합

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

모델 일반화 향상

 

  • 다양한 관점과 문맥을 반영
  • 선호와 가치를 일반화

다양한 의견 말풍선을 든 손들의 이미지.

Reinforcement Learning from Human Feedback (RLHF)

편향 감소

  • 개인 편향 완화
  • 더 균형 있고 공정한 모델 출력 생성

남성 편향 데이터셋과 남녀가 균등한 균형 데이터셋의 차이를 보여주는 막대 그래프

Reinforcement Learning from Human Feedback (RLHF)

인간 가치와의 정렬 향상

  • 복잡한 인간 선호 반영
  • 다양한 문화와 배경 대표

다양한 사람들을 나타내는 아이콘

Reinforcement Learning from Human Feedback (RLHF)

적응력 향상

  • 더 다양한 사용자 요구와 선호에 대응
  • 다양한 관점을 반영

다양한 관점을 나타내는 이모지를 가진 사람 아이콘.

Reinforcement Learning from Human Feedback (RLHF)

견고성 증대

  • 다양한 입력에 견고함
  • 성능 개선

다양한 입력과 문맥 덕분에 품질이 향상되는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

다중 출처 선호 데이터 통합

preference_df의 선호 데이터: 출처는 'Journalist', 'Social Media Influencer', 'Marketing Professional'

세 가지 서로 다른 출처의 구조화된 데이터를 보여주는 표

Reinforcement Learning from Human Feedback (RLHF)

다수결 투표

이 예시 데이터는 'id'로 그룹화해 쉽게 통합할 수 있습니다:

df_majority = preference_df.groupby(['id']).apply(majority_vote)

그다음 다수결을 사용합니다:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

신뢰할 수 없는 선호 데이터 출처

동일한 세 전문가의 선호 데이터 preference_df2:

세 가지 서로 다른 출처의 구조화된 데이터를 보여주는 표

Reinforcement Learning from Human Feedback (RLHF)

신뢰할 수 없는 선호 데이터 출처

  • preference_df2의 행을 순회해 신뢰할 수 없는 출처를 식별:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

연습해 봅시다!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...