सक्रिय लर्निंग

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

ह्यूमन-इन-द-लूप सिस्टम्स

एक LLM का डायग्राम, जिसका आउटपुट मानव समीक्षक द्वारा जाँचा गया है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

ह्यूमन-इन-द-लूप सिस्टम्स

एक LLM का डायग्राम, जिसके बहुत-से आउटपुट डेटा को मानव समीक्षक जाँचता है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

ह्यूमन-इन-द-लूप सिस्टम्स

एक LLM का डायग्राम, जहाँ आउटपुट से यादृच्छिक डेटा मानव समीक्षक द्वारा जाँचा गया है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

ह्यूमन-इन-द-लूप सिस्टम्स

एक LLM का डायग्राम, जहाँ सक्रिय रूप से चुना गया डेटा मानव समीक्षक द्वारा जाँचा गया है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF में सक्रिय लर्निंग

रिवार्ड मॉडल भाग के बिना RLHF प्रक्रिया.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF में सक्रिय लर्निंग

पूर्ण RLHF प्रक्रिया

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

सक्रिय लर्निंग

इनपुट डेटा दर्शाने वाले दस्तावेज़ों का एक आइकन.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

सक्रिय लर्निंग

मॉडल में जाने वाले डेटा के दस्तावेज़ों का एक आइकन.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

सक्रिय लर्निंग

मॉडल में जाने वाले डेटा के दस्तावेज़ों का आइकन, और "model confident" लेबल वाला तीर आउटपुट की ओर.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

सक्रिय लर्निंग

मॉडल में जाने वाले डेटा के दस्तावेज़ों का आइकन, "model confident" लेबल वाला तीर आउटपुट की ओर, और समानांतर तीर एक मानव की ओर, लेबल: "model unsure" और "human reviews and corrects".

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

सक्रिय लर्निंग

मॉडल में जाने वाले डेटा के दस्तावेज़ों का आइकन, "model confident" लेबल वाला तीर आउटपुट की ओर, समानांतर तीर एक मानव की ओर, लेबल "model unsure" और "human reviews and corrects", और एक prediction आउटपुट.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

लो-कॉन्फिडेंस के साथ सक्रिय लर्निंग पाइपलाइन

from modAL.models import ActiveLearner

# Initialize learner learner = ActiveLearner( estimator=LogisticRegression(), query_strategy=uncertainty_sampling, X_training=X_labeled, y_training=y_labeled )
  • Uncertainty sampling: जहाँ confidence सबसे कम हो, वे points चुने जाते हैं
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

लो-कॉन्फिडेंस के साथ सक्रिय लर्निंग पाइपलाइन

# Active learning loop
for _ in range(10):
    learner.teach(X_labeled, y_labeled)
    query_idx, _ = learner.query(X_unlabeled)
    X_labeled = np.vstack((X_labeled, X_unlabeled[query_idx]))
    y_labeled = np.append(y_labeled, y[query_idx])

X_unlabeled = np.delete(X_unlabeled, query_idx, axis=0)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...