Aktywne uczenie

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Systemy z człowiekiem w pętli

Diagram LLM z wynikiem ocenianym przez recenzenta.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Systemy z człowiekiem w pętli

Diagram LLM z dużą ilością danych wyjściowych ocenianych przez recenzenta.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Systemy z człowiekiem w pętli

Diagram LLM z losowo wybranymi danymi wyjściowymi ocenianymi przez recenzenta.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Systemy z człowiekiem w pętli

Diagram LLM z aktywnie wybranymi danymi ocenianymi przez recenzenta.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie w RLHF

Proces RLHF bez części dotyczącej modelu nagrody.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie w RLHF

Pełny proces RLHF

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie

Ikona dokumentów reprezentująca dane wejściowe.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie

Ikona dokumentów reprezentująca dane wchodzące do modelu.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie

Ikona dokumentów reprezentująca dane wchodzące do modelu oraz strzałka z etykietą „model pewny" wskazująca na wynik.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie

Ikona dokumentów reprezentująca dane wchodzące do modelu, strzałka z etykietą „model pewny" wskazująca na wynik oraz równoległa strzałka w kierunku człowieka z etykietami: „model niepewny" i „człowiek weryfikuje i poprawia".

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Aktywne uczenie

Ikona dokumentów reprezentująca dane wchodzące do modelu, strzałka z etykietą „model pewny" wskazująca na wynik, równoległa strzałka w kierunku człowieka z etykietami „model niepewny" i „człowiek weryfikuje i poprawia" oraz wynik predykcji.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Potok aktywnego uczenia przy niskiej pewności

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • Próbkowanie niepewności: wybierane są punkty o najniższej pewności
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Potok aktywnego uczenia przy niskiej pewności

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na ćwiczenia!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...