Dataproblem och överväganden

Koncept inom stora språkmodeller (LLM)

Vidhi Chugh

AI strategist and ethicist

Dataöverväganden

 

Dataöverväganden

 

  • Datavolym och beräkningskraft
  • Datakvalitet
  • Märkning
  • Bias
  • Integritet
Koncept inom stora språkmodeller (LLM)

Datavolym och beräkningskraft

  • LLM:er behöver stora datamängder
    • Liknar ett barn som lär sig tala
    • 570 GB, ~1,3 miljoner böcker

 

Barn som lär sig tala

1 Freepik
Koncept inom stora språkmodeller (LLM)

Datavolym och beräkningskraft

  • LLM:er behöver stora datamängder
    • Liknar ett barn som lär sig tala
    • 570 GB, ~1,3 miljoner böcker

 

  • Enorm beräkningskraft krävs – tänk på energiförbrukningen

 

  • Kan kosta miljontals dollar!

Man som arbetar vid en dator ansluten till en stor server

Koncept inom stora språkmodeller (LLM)

Datakvalitet

  • Hög datakvalitet är avgörande

 

  • Korrekt data = bättre inlärning = bättre svar = ökat förtroende

 

  • Som ett barn som lär sig tala
    • Skräp in -> skräp ut

Låg kvalitet på utdata om LLM:er tränas på data med fel eller dålig grammatik

Koncept inom stora språkmodeller (LLM)

Märkt data

  • Korrekta dataetiketter: noggrann inlärning, generalisering av mönster, korrekta svar

  • Arbetskrävande: tilldela rätt etikett till varje artikel

Team som arbetar vid datorer för att märka data

  • Felaktiga etiketter påverkar modellens prestanda
  • Åtgärda fel: identifiera -> analysera -> iterera
Koncept inom stora språkmodeller (LLM)

Databias

  • Påverkad av samhälleliga stereotyper
  • Brist på mångfald i träningsdata
  • Diskriminering och orättvisa utfall

 

  • Identifiera och hantera biasad data
    • Utvärdera dataobalanser
    • Främja mångfald
    • Tekniker för biasminskning: fler varierade exempel

Databias

  • Exempel:

    • "The nurse said that..." -> "she" eller "her"
Koncept inom stora språkmodeller (LLM)

Dataintegritet

  • Efterlevnad av dataskydds- och integritetsregler

 

  • Integritet är en viktig fråga
    • Träning på data utan tillstånd kan leda till dataintrång
    • Juridisk, ekonomisk och anseendemässig skada
  • Känslig eller personligt identifierbar information (PII)

 

  • Inhämta tillstånd

Dataintegritet

Koncept inom stora språkmodeller (LLM)

Nu kör vi en övning!

Koncept inom stora språkmodeller (LLM)

Preparing Video For Download...