RLHF 소개

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

과정에 오신 것을 환영합니다!

 

  • 강사: Mina Parham

 

  • AI 엔지니어
  • 대형 언어 모델(LLM)
  • 인간 피드백 기반 강화학습(RLHF)

 

  • 주제: 인간 피드백 기반 강화학습(RLHF)

추가 단계로 인간이 관여하는 AI 모델을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

과정에 오신 것을 환영합니다!

 

  • 강사: Mina Parham

 

  • AI 엔지니어
  • 대형 언어 모델(LLM)
  • 인간 피드백 기반 강화학습(RLHF)

 

  • 주제: 인간 피드백 기반 강화학습(RLHF)

추가 단계로 인간이 관여하여 더 나은 결과로 이어지는 AI 모델 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

강화학습 복습

에이전트, 행동, 보상 정책 아이콘이 순환하는 강화학습 과정을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

강화학습 복습

에이전트, 행동, 보상 정책 아이콘이 순환하는 강화학습 과정을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

강화학습 복습

에이전트, 행동, 보상 정책 아이콘이 순환하는 강화학습 과정을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

강화학습 복습

에이전트, 행동, 보상 정책 아이콘이 순환하는 강화학습 과정을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

RL에서 RLHF로

 

  LLM, 텍스트 출력, 인간 평가자를 보여주는, 인간 피드백 기반 강화학습의 일부 순환을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

RL에서 RLHF로

 

  LLM, 텍스트 출력, 인간 평가자를 보여주는, 인간 피드백 기반 강화학습의 일부 순환을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

RL에서 RLHF로

  • 보상 모델 학습
  • 인간 선호와 정렬

LLM, 텍스트 출력, 인간 평가자를 보여주는, 인간 피드백 기반 강화학습의 일부 순환을 나타내는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

RLHF의 LLM 파인튜닝

 

대형 언어 모델 아이콘.

Reinforcement Learning from Human Feedback (RLHF)

RLHF의 LLM 파인튜닝

  • 초기 LLM 학습

입력 데이터셋으로 파인튜닝된 대형 언어 모델 아이콘.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

"로미오와 줄리엣"을 누가 썼는지 묻는 프롬프트가 LLM으로 입력됨.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

"로미오와 줄리엣"을 누가 썼는지 묻는 프롬프트에 LLM이 "16세기 작가"라고 답변.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

"로미오와 줄리엣"을 누가 썼는지 묻는 프롬프트에 LLM이 "16세기 작가"라고 답하고, 추가 모델(정책 모델)이 프롬프트를 받음.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

"로미오와 줄리엣" 질문에 LLM이 "16세기 작가"라고 답하고, 정책 모델이 보상 모델로 학습됨.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

정책 모델이 보상 모델로 학습되어 "William Shakespeare"라고 정답을 제시함.

Reinforcement Learning from Human Feedback (RLHF)

전체 RLHF 프로세스

두 결과를 비교 확인하는 단계 포함: 기존 LLM의 "16세기 작가"와 정책 모델의 "William Shakespeare".

Reinforcement Learning from Human Feedback (RLHF)

RLHF 튜닝 LLM과 상호작용

  • Hugging Face의 사전 학습 RLHF 모델 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
Reinforcement Learning from Human Feedback (RLHF)

RLHF 튜닝 LLM과 상호작용

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
Reinforcement Learning from Human Feedback (RLHF)

연습해 봅시다!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...