Dataintegrering
Ansvarsfull AI-datahantering
Maria Prokofieva
Lead ML engineer
Vad vi går igenom
Varför integrering behövs
Fördelar och utmaningar
Steg för dataintegrering
Varför flera källor?
Heltäckande detaljerad bild
Skyddsnät
Datamångfald och rättvisa
Förklarbarhet, transparens och ansvarsskyldighet
Var uppmärksam på problem
Komprometterar datakvaliteten
Skapar inkonsekvenser
Förstärker bias
Minskar representationen
Modellkomplexitet
Minskad transparens och förklarbarhet
1
Bild av Streamline HQ
Steg 1. Val av datakällor
Följ utvärderingsstegen
Bedöm datakällorna
Mer balanserad och heltäckande datamängd
Steg 2. Anpassa datatyper
Identifiera gemensamma variabler
Standardisera namn och format
Normalisera numeriska data
Konsolidera kategoriska data
Anpassa datagranulariteten
Steg 3. Förbättring av bias och representation
Viktning
Domänkunskap
Tilldela vikter till under- eller överrepresenterade grupper
Balansering
Likvärdig representation
Över- eller undersampling
Algoritmiska kontroller
Gapanalys
Steg 4. Dokumentera
Detaljerade poster:
Steg i dataintegrering
Fattade beslut
Detaljerad metadata:
Datakällor
Insamlingsmetodik
Tillämpade transformationer
Projekt för stadstrafik
Välj datakällor
Identifiera gemensamma särdrag
Utveckla en enhetlig datamodell
1
Bilder av Streamline HQ
Projekt för stadstrafik
Använd statistiska tekniker för bias och representation
Tillämpa viktningsjusteringar
Gapanalys och omviktning
Dokumentera
Nu kör vi en övning!
Ansvarsfull AI-datahantering
Preparing Video For Download...