Активное обучение

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Mina Parham

AI Engineer

Системы с участием человека

Диаграмма LLM, выходные данные которой оцениваются рецензентом-человеком.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Системы с участием человека

Диаграмма LLM с большим объёмом выходных данных, оцениваемых рецензентом-человеком.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Системы с участием человека

Диаграмма LLM со случайно выбранными выходными данными, оцениваемыми рецензентом-человеком.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Системы с участием человека

Диаграмма LLM с целенаправленно отобранными данными, оцениваемыми рецензентом-человеком.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение в RLHF

Процесс RLHF без блока модели вознаграждения.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение в RLHF

Полный процесс RLHF

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение

Значок документов, представляющих входные данные.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение

Значок документов, представляющих данные, поступающие в модель.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение

Значок документов, представляющих данные, поступающие в модель, со стрелкой с подписью «модель уверена», направленной к выходным данным.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение

Значок документов, представляющих данные, поступающие в модель; стрелка с подписью «модель уверена» направлена к выходным данным; параллельная стрелка направлена к человеку с подписями «модель не уверена» и «человек проверяет и исправляет».

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Активное обучение

Значок документов, представляющих данные, поступающие в модель; стрелка «модель уверена» к выходным данным; параллельная стрелка к человеку с подписями «модель не уверена» и «человек проверяет и исправляет»; выходной прогноз.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Конвейер активного обучения с низкой уверенностью

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • Выборка по неопределённости: выбираются точки с наименьшей уверенностью модели
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Конвейер активного обучения с низкой уверенностью

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Давайте потренируемся!

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Preparing Video For Download...