Osvědčené postupy validace dat
Zodpovědná správa dat v AI
Maria Prokofieva
Lead ML engineer
Co si ukážeme
Analýza podskupin
Chybějící hodnoty
Odstranění odlehlých hodnot
Oprava nekonzistencí v datech
Škálování příznaků
Kódování příznaků
Redukce dimenzionality
Analýza podskupin
Chybějící data
Běžné ve velkých datových sadách
Mazání dat
Strategie imputace a přístupy založené na modelech
Analýza podskupin pro validaci
Odstranění odlehlých hodnot
Statistické metody jako z-skóre a IQR nebo robustní škálování
Validace spravedlivého zpracování napříč datovými segmenty
Nekonzistence v datech
Kvalita dat ovlivňuje integritu a spolehlivost modelu
Standardizace dat a validační pravidla
Normalizace napříč podskupinami
Škálování příznaků
Škálování vstupních příznaků
Validace porovnáním distribucí mezi skupinami
Kódování příznaků
Posouzení vlivu kódování na výsledky
Kontrola předpojatosti a ztráty informací
Kontrola přeučení
Regularizace a redukce dimenzionality
Redukce dimenzionality
Redukce příznaků při zachování klíčových informací
Může způsobovat předpojatost
Použití technik zohledňujících férovost, např. t-SNE
Finanční poradce
Příznaky „Roční příjem" a „Frekvence investic"
Úprava odlehlých hodnot a škálování
Analýza podskupin
Pojďme procvičovat!
Zodpovědná správa dat v AI
Preparing Video For Download...