Enjeux et considérations liés aux données

Concepts sur les grands modèles de langage (LLM)

Vidhi Chugh

AI strategist and ethicist

Considérations sur les données

 

Considérations sur les données

 

  • Volume de données et puissance de calcul
  • Qualité des données
  • Étiquetage
  • Biais
  • Vie privée
Concepts sur les grands modèles de langage (LLM)

Volume de données et puissance de calcul

  • Les LLM exigent beaucoup de données
    • Comparable à un enfant qui apprend à parler
    • 570 Go, ~1,3 million de livres

 

Enfant qui apprend à parler

1 Freepik
Concepts sur les grands modèles de langage (LLM)

Volume de données et puissance de calcul

  • Les LLM exigent beaucoup de données
    • Comparable à un enfant qui apprend à parler
    • 570 Go, ~1,3 million de livres

 

  • Puissance de calcul élevée ; pensez à la consommation d'énergie

 

  • Peut coûter des millions de dollars !

Homme travaillant à un ordinateur branché à un gros serveur

Concepts sur les grands modèles de langage (LLM)

Qualité des données

  • Des données de qualité sont essentielles

 

  • Données exactes = meilleur apprentissage = réponses de meilleure qualité = confiance accrue

 

  • Un enfant qui apprend à parler
    • Charabia en entrée → charabia en sortie

résultats de faible qualité si on entraîne des LLM avec des données remplies d'erreurs ou de grammaire médiocre

Concepts sur les grands modèles de langage (LLM)

Données étiquetées

  • Bonne étiquette de données : apprentissage exact, généralisation des motifs, réponses justes

  • Travail intensif : attribuer la bonne étiquette à chaque article

Équipe travaillant à l'ordinateur pour étiqueter des données

  • Des étiquettes erronées nuisent au rendement du modèle
  • Corriger les erreurs : repérer → analyser → itérer
Concepts sur les grands modèles de langage (LLM)

Biais des données

  • Influencés par les stéréotypes sociaux
  • Manque de diversité dans les données d'entraînement
  • Discrimination et résultats inéquitables

 

  • Repérer et traiter les données biaisées
    • Évaluer les déséquilibres
    • Favoriser la diversité
    • Techniques d'atténuation du biais : exemples plus diversifiés

Biais des données

  • Exemple :

    • « L'infirmier ou l'infirmière a dit que… » → « elle » ou « sa »
Concepts sur les grands modèles de langage (LLM)

Protection des données personnelles

  • Respecter les lois sur la protection des données et la vie privée

 

  • La vie privée est un enjeu
    • L'entraînement sur des données sans permission peut entraîner une atteinte
    • Risques juridiques, financiers et réputationnels
  • Renseignements sensibles ou personnels identifiables (PII)

 

  • Obtenir la permission

Confidentialité des données

Concepts sur les grands modèles de langage (LLM)

Passons à la pratique !

Concepts sur les grands modèles de langage (LLM)

Preparing Video For Download...