Bästa praxis för datavalidering
Ansvarsfull AI-datahantering
Maria Prokofieva
Lead ML engineer
Vad vi går igenom
Undergruppsanalys
Saknade värden
Borttagning av avvikare
Korrigering av datainkonsekvenser
Särdragsskalning
Särdragskodning
Dimensionsreduktion
Undergruppsanalys
Saknade data
Vanligt i stora datamängder
Borttagning av data
Imputeringsstrategier och modellbaserade metoder
Undergruppsanalys för validering
Borttagning av avvikare
Statistiska metoder som z-poäng och IQR, eller robust skalning
Validera för rättvis behandling över datasegment
Datainkonsekvenser
Datakvalitet påverkar modellens integritet och tillförlitlighet
Datastandardisering och valideringsregler
Undergruppsnormalisering
Särdragsskalning
Särdragsskalning för att transformera indatasärdrag
Validera genom att kontrollera fördelningar mellan grupper
Särdragskodning
Bedöm kodningens effekt på utfall
Kontrollera för snedvridning och informationsförlust
Kontrollera för överanpassning
Använd regularisering och dimensionsreduktion
Dimensionsreduktion
Minska antalet indatasärdrag och bevara viktig information
Kan skapa snedvridning
Använd rättviseinriktade tekniker som t-SNE
Finansiell rådgivare
Särdragen "Årsinkomst" och "Investeringsfrekvens"
Justera avvikare och skala
Undergruppsanalys
Nu kör vi en övning!
Ansvarsfull AI-datahantering
Preparing Video For Download...