고급 파인튜닝
대형 언어 모델(LLM)의 개념
Vidhi Chugh
AI strategist and ethicist
지금 우리는 어디쯤?
인간 피드백을 통한 강화 학습
사전 학습
파인튜닝
인간 피드백을 통한 강화 학습 (RLHF)
사전 학습
대규모 텍스트 데이터:
웹사이트, 도서 및 기사
트랜스포머 아키텍처
일반적인 언어 패턴, 문법, 사실을 학습
다음 단어 예측
마스킹 언어 모델링
1
Freepik
파인튜닝
N-샷 학습
관련 작업을 위한 소규모 라벨링 데이터 세트
그렇다면, 왜 RLHF일까?
범용 학습 데이터의 품질 부족
노이즈
오류
일관성 없음
정확도 저하
정확도 저하 예시:
온라인 토론 포럼의 데이터로 학습됨
검증되지 않은 의견 및 사실 포함
외부 전문가의 검증 필요
파인튜닝의 필요성에서 시작
사전 학습
기본 언어의 패턴을 학습
문맥별 복잡성을 잘 포착하지 못함
파인튜닝
고품질 라벨이 지정된 데이터는 성능을 향상시킴
RLHF 도입!
사람의 피드백
RLHF 한눈에 보기
모델 출력은 사람 {{1}}에 의해 검토됨
피드백 {{2}}을 기반으로 모델 업데이트
1단계:
프롬프트 수신
여러 개의 응답 생성
인간 전문가 참여
2단계:
인간 전문가가 응답을 검토
품질에 따라 응답에 순위를 부여
정확성
관련성
일관성
피드백 시간
3단계:
전문가의 순위로부터 학습
향후 응답을 그 선호에 맞춤
그리고 반복 진행!
계속해서 응답을 생성
전문가의 순위 평가 수신
학습 {{4}}을 조정
복습
사전 학습
을 통해 일반 언어 지식을 학습
특정 작업作業을 위한
파인튜닝
RLHF
을 활용해 인간 피드백을 통한 파인튜닝 강화
조합하면 매우 효과적!
LLM 완성
연습해봅시다!
대형 언어 모델(LLM)의 개념
Preparing Video For Download...