Aktivní učení

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Systémy s člověkem v procesu

Diagram LLM s výstupem hodnoceným lidským recenzentem.

Reinforcement Learning from Human Feedback (RLHF)

Systémy s člověkem v procesu

Diagram LLM s velkým objemem dat ve výstupu hodnoceném lidským recenzentem.

Reinforcement Learning from Human Feedback (RLHF)

Systémy s člověkem v procesu

Diagram LLM s náhodným výběrem dat ve výstupu hodnoceném lidským recenzentem.

Reinforcement Learning from Human Feedback (RLHF)

Systémy s člověkem v procesu

Diagram LLM s aktivně vybranými daty hodnocenými lidským recenzentem.

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení v RLHF

Proces RLHF bez části s modelem odměn.

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení v RLHF

Celý proces RLHF

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení

Ikona dokumentů představující vstupní data.

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení

Ikona dokumentů představující data vstupující do modelu.

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení

Ikona dokumentů představující data vstupující do modelu a šipka s popiskem „model confident" směřující k výstupu.

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení

Ikona dokumentů představující data vstupující do modelu, šipka s popiskem „model confident" směřující k výstupu a paralelní šipka směřující k člověku s popisky: „model unsure" a „human reviews and corrects".

Reinforcement Learning from Human Feedback (RLHF)

Aktivní učení

Ikona dokumentů představující data vstupující do modelu, šipka s popiskem „model confident" směřující k výstupu, paralelní šipka směřující k člověku s popisky „model unsure" a „human reviews and corrects" a výstup předpovědi.

Reinforcement Learning from Human Feedback (RLHF)

Pipeline aktivního učení s nízkou jistotou

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • Vzorkování nejistoty: vybírají se body s nejnižší jistotou
Reinforcement Learning from Human Feedback (RLHF)

Pipeline aktivního učení s nízkou jistotou

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
Reinforcement Learning from Human Feedback (RLHF)

Pojďme cvičit!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...