능동 학습

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

휴먼 인 더 루프 시스템

사람 검토자가 출력물을 평가하는 LLM 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

휴먼 인 더 루프 시스템

사람 검토자가 대량의 출력을 평가하는 LLM 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

휴먼 인 더 루프 시스템

무작위로 선택된 출력을 사람 검토자가 평가하는 LLM 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

휴먼 인 더 루프 시스템

능동적으로 선택된 데이터를 사람 검토자가 평가하는 LLM 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

RLHF에서의 능동 학습

보상 모델을 제외한 RLHF 프로세스.

Reinforcement Learning from Human Feedback (RLHF)

RLHF에서의 능동 학습

전체 RLHF 프로세스

Reinforcement Learning from Human Feedback (RLHF)

능동 학습

입력 데이터를 나타내는 문서 아이콘.

Reinforcement Learning from Human Feedback (RLHF)

능동 학습

모델로 들어가는 데이터를 나타내는 문서 아이콘.

Reinforcement Learning from Human Feedback (RLHF)

능동 학습

모델로 들어가는 데이터를 나타내는 문서 아이콘과, 출력으로 향하는 "모델 확신" 화살표.

Reinforcement Learning from Human Feedback (RLHF)

능동 학습

모델로 들어가는 데이터를 나타내는 문서 아이콘, 출력으로 향하는 "모델 확신" 화살표, 그리고 "모델 불확실", "사람이 검토 및 수정" 라벨과 함께 사람으로 향하는 평행 화살표.

Reinforcement Learning from Human Feedback (RLHF)

능동 학습

모델로 들어가는 데이터를 나타내는 문서 아이콘, 출력으로 향하는 "모델 확신" 화살표, "모델 불확실"과 "사람이 검토 및 수정" 라벨이 있는 사람으로의 평행 화살표, 그리고 예측 출력.

Reinforcement Learning from Human Feedback (RLHF)

저신뢰도 기반 능동 학습 파이프라인

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • 불확실성 샘플링: 신뢰도가 가장 낮은 지점을 선택
Reinforcement Learning from Human Feedback (RLHF)

저신뢰도 기반 능동 학습 파이프라인

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
Reinforcement Learning from Human Feedback (RLHF)

연습해 봅시다!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...