Học chủ động

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Hệ thống có con người trong vòng lặp

Sơ đồ LLM với đầu ra được người đánh giá xem xét.

Reinforcement Learning from Human Feedback (RLHF)

Hệ thống có con người trong vòng lặp

Sơ đồ LLM với lượng lớn dữ liệu đầu ra được người đánh giá xem xét.

Reinforcement Learning from Human Feedback (RLHF)

Hệ thống có con người trong vòng lặp

Sơ đồ LLM với lựa chọn ngẫu nhiên dữ liệu đầu ra được người đánh giá xem xét.

Reinforcement Learning from Human Feedback (RLHF)

Hệ thống có con người trong vòng lặp

Sơ đồ LLM với dữ liệu được chọn chủ động được người đánh giá xem xét.

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động trong RLHF

Quy trình RLHF không có phần mô hình phần thưởng.

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động trong RLHF

Quy trình RLHF đầy đủ

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động

Biểu tượng tài liệu đại diện dữ liệu đầu vào.

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động

Biểu tượng tài liệu đại diện dữ liệu đưa vào mô hình.

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động

Biểu tượng tài liệu đưa vào mô hình, và mũi tên nhãn "model confident" hướng tới đầu ra.

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động

Biểu tượng tài liệu đưa vào mô hình, một mũi tên nhãn "model confident" hướng tới đầu ra, và mũi tên song song hướng tới con người với nhãn: "model unsure" và "human reviews and corrects".

Reinforcement Learning from Human Feedback (RLHF)

Học chủ động

Biểu tượng tài liệu đưa vào mô hình, mũi tên nhãn "model confident" hướng tới đầu ra, mũi tên song song hướng tới con người với nhãn "model unsure" và "human reviews and corrects", và một dự đoán đầu ra.

Reinforcement Learning from Human Feedback (RLHF)

Pipeline học chủ động với độ tin thấp

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • Uncertainty sampling: chọn điểm có độ tự tin thấp nhất
Reinforcement Learning from Human Feedback (RLHF)

Pipeline học chủ động với độ tin thấp

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...