고급 파인튜닝

대형 언어 모델(LLM)의 개념

Vidhi Chugh

AI strategist and ethicist

지금 우리는 어디쯤?

progress image showing we are at Advanced fine-tuning stage

대형 언어 모델(LLM)의 개념

인간 피드백을 통한 강화 학습

  • 사전 학습
  • 파인튜닝
  • 인간 피드백을 통한 강화 학습 (RLHF)

이모지와 별을 사용해 긍정적인 피드백을 제공하는 네 사람의 일러스트.

대형 언어 모델(LLM)의 개념

사전 학습

  • 대규모 텍스트 데이터:
    • 웹사이트, 도서 및 기사
    • 트랜스포머 아키텍처
    • 일반적인 언어 패턴, 문법, 사실을 학습
  • 다음 단어 예측
  • 마스킹 언어 모델링

LLM을 구축하기 위한 사전 학습 과정

1 Freepik
대형 언어 모델(LLM)의 개념

파인튜닝

  • N-샷 학습
  • 관련 작업을 위한 소규모 라벨링 데이터 세트

Fine tuning process

대형 언어 모델(LLM)의 개념

그렇다면, 왜 RLHF일까?

  • 범용 학습 데이터의 품질 부족
    • 노이즈
    • 오류
    • 일관성 없음
    • 정확도 저하

정확도 저하 예시:

  • 온라인 토론 포럼의 데이터로 학습됨
  • 검증되지 않은 의견 및 사실 포함
  • 외부 전문가의 검증 필요

과녁 중앙을 빗나간 화살이 꽂힌 양궁 과녁

대형 언어 모델(LLM)의 개념

파인튜닝의 필요성에서 시작

  • 사전 학습
    • 기본 언어의 패턴을 학습
    • 문맥별 복잡성을 잘 포착하지 못함
  • 파인튜닝
    • 고품질 라벨이 지정된 데이터는 성능을 향상시킴
  • RLHF 도입!
    • 사람의 피드백
대형 언어 모델(LLM)의 개념

RLHF 한눈에 보기

  • 모델 출력은 사람 {{1}}에 의해 검토됨
  • 피드백 {{2}}을 기반으로 모델 업데이트
  • 1단계:
    • 프롬프트 수신
    • 여러 개의 응답 생성

입력 프롬프트를 소비하고 응답을 생성하는 LLM

대형 언어 모델(LLM)의 개념

인간 전문가 참여

  • 2단계:
    • 인간 전문가가 응답을 검토
    • 품질에 따라 응답에 순위를 부여
      • 정확성
      • 관련성
      • 일관성

adding human verification to LLMs response

대형 언어 모델(LLM)의 개념

피드백 시간

  • 3단계:
    • 전문가의 순위로부터 학습
    • 향후 응답을 그 선호에 맞춤
  • 그리고 반복 진행!
    • 계속해서 응답을 생성
    • 전문가의 순위 평가 수신
    • 학습 {{4}}을 조정

인간 응답이 LLM에 피드백됩니다

대형 언어 모델(LLM)의 개념

복습

  • 사전 학습을 통해 일반 언어 지식을 학습
  • 특정 작업作業을 위한 파인튜닝
  • RLHF 을 활용해 인간 피드백을 통한 파인튜닝 강화
  • 조합하면 매우 효과적!
대형 언어 모델(LLM)의 개념

LLM 완성

The complete LLM training process

대형 언어 모델(LLM)의 개념

연습해봅시다!

대형 언어 모델(LLM)의 개념

Preparing Video For Download...