Использование разнообразных источников обратной связи

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Mina Parham

AI Engineer

Улучшение обобщающей способности модели

 

  • Отражают разные точки зрения и контексты
  • Обобщают предпочтения и ценности

Изображение рук с разными выносками, отражающими разнообразные мнения.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Снижение предвзятости

  • Снижает индивидуальные предубеждения
  • Делает результаты модели более сбалансированными и справедливыми

Столбчатая диаграмма, показывающая разницу между набором данных с перекосом в сторону мужчин и сбалансированным набором с равным распределением по полу

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Лучшее соответствие человеческим ценностям

  • Сложные предпочтения людей
  • Представлены разные культуры и слои общества

Иконки, представляющие разнообразную группу людей

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Повышение адаптивности

  • Модель учитывает более широкий круг потребностей и предпочтений пользователей
  • Отражает разные точки зрения

Иконка с изображением человека и эмодзи, отражающими разные точки зрения.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Повышение устойчивости

  • Устойчивость к различным типам входных данных
  • Улучшение качества работы

Диаграмма, показывающая улучшение качества за счёт разнообразных входных данных и контекстов.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Интеграция данных предпочтений из нескольких источников

Данные предпочтений preference_df с источниками 'Journalist', 'Social Media Influencer' и 'Marketing Professional':

Таблица со структурированными данными из трёх различных источников

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Голосование большинством

Эти данные легко интегрировать, сгруппировав по 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Затем применяем метод большинства голосов:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Ненадёжные источники данных предпочтений

Данные предпочтений preference_df2 с теми же тремя экспертами:

Таблица со структурированными данными из трёх различных источников

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Ненадёжные источники данных предпочтений

  • Перебор строк preference_df2 для выявления ненадёжных источников:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Давайте потренируемся!

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Preparing Video For Download...