Ajustement avancé

Concepts sur les grands modèles de langage (LLM)

Vidhi Chugh

AI strategist and ethicist

Où en sommes-nous ?

image de progression indiquant l'étape Ajustement avancé

Concepts sur les grands modèles de langage (LLM)

Reinforcement Learning through Human Feedback

 

  • Préentraînement

 

  • Ajustement fin

 

  • Reinforcement Learning through Human Feedback (RLHF)

 

Illustration de quatre personnes donnant une rétroaction positive avec des émojis et des étoiles.

Concepts sur les grands modèles de langage (LLM)

Préentraînement

  • Grandes quantités de textes :
    • Sites Web, livres et articles
    • Architecture Transformer
    • Apprend les motifs linguistiques, la grammaire et des faits

 

  • Prédiction du mot suivant
  • Modélisation de langue masquée

Processus de préentraînement pour construire des LLM

1 Freepik
Concepts sur les grands modèles de langage (LLM)

Ajustement fin

 

  • Entraînement à N exemples

 

  • Petit ensemble étiqueté pour une tâche connexe

Processus d'ajustement fin

Concepts sur les grands modèles de langage (LLM)

Mais pourquoi le RLHF ?

  • Données générales de formation de qualité variable
    • Bruit
    • Erreurs
    • Incohérences
    • Précision réduite

Exemple de précision réduite :

  • Entraîné sur des forums de discussion en ligne
  • Opinions et faits non validés
  • Exige une validation experte externe

 

Cible de tir à l'arc avec des flèches manquant le centre

Concepts sur les grands modèles de langage (LLM)

Le besoin d'ajuster finement

  • Préentraînement
    • Apprend les motifs sous-jacents de la langue
    • Ne saisit pas toutes les complexités liées au contexte

 

  • Ajustement fin
    • Des données étiquetées de qualité améliorent la performance

 

  • Place au RLHF !
    • Rétroaction humaine
Concepts sur les grands modèles de langage (LLM)

Simplifier le RLHF

 

  • Sortie du modèle révisée par une personne
  • Met à jour le modèle selon la rétroaction

 

  • Étape 1 :
    • Reçoit une invite
    • Génère plusieurs réponses

 

 

un LLM recevant une invite et générant une réponse

Concepts sur les grands modèles de langage (LLM)

Arrive l'expert humain

 

  • Étape 2 :
    • Un expert humain vérifie ces réponses
    • Classe les réponses selon la qualité
      • Exactitude
      • Pertinence
      • Cohérence

ajout d'une vérification humaine aux réponses du LLM

Concepts sur les grands modèles de langage (LLM)

Place à la rétroaction

  • Étape 3 :
    • Apprend du classement de l'expert
    • Pour aligner ses réponses futures sur ses préférences

 

  • Et ça continue !
    • Continue de générer des réponses
    • Reçoit les classements de l'expert
    • Ajuste l'apprentissage

 

 

La rétroaction humaine est renvoyée au LLM

Concepts sur les grands modèles de langage (LLM)

Récapitulatif

  • Préentraînement pour acquérir des connaissances linguistiques générales

 

  • Ajustement fin pour des tâches précises

 

  • Techniques de RLHF pour rehausser l'ajustement grâce à la rétroaction humaine

 

  • La combinaison est très efficace !
Concepts sur les grands modèles de langage (LLM)

Finaliser le LLM

Processus complet d'entraînement d'un LLM

Concepts sur les grands modèles de langage (LLM)

Passons à la pratique !

Concepts sur les grands modèles de langage (LLM)

Preparing Video For Download...