RLHF の学習をまとめましょう

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

基礎概念から旅を始める

AI が浸透した世界にいる人のイラスト。

人間のフィードバックによる強化学習(RLHF)

高品質なフィードバックの収集

  両手に「承認」アイコンと「却下」アイコンの札を持つ人物。

人間のフィードバックによる強化学習(RLHF)

報酬モデルと人間参加のループ

四人乗り自転車に人と3体のロボットが乗るイラスト。人と機械の協働を表す。

人間のフィードバックによる強化学習(RLHF)

指標と評価

4人の同僚アイコンが拡大鏡で大画面の指標を見る様子。モデル評価を表す。

人間のフィードバックによる強化学習(RLHF)

おめでとうございます!

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...