Лучшие практики валидации данных
Ответственное управление данными в ИИ
Maria Prokofieva
Lead ML engineer
План
Анализ подгрупп
Пропущенные значения
Удаление выбросов
Устранение несоответствий в данных
Масштабирование признаков
Кодирование признаков
Снижение размерности
Анализ подгрупп
Пропущенные данные
Часто встречается в больших наборах данных
Удаление данных
Стратегии импутации и подходы на основе моделей
Анализ подгрупп для валидации
Удаление выбросов
Статистические методы: z-оценки, IQR или робастное масштабирование
Валидация справедливого обращения между сегментами данных
Несоответствия в данных
Качество данных влияет на целостность и надёжность модели
Стандартизация данных и правила валидации
Нормализация по подгруппам
Масштабирование признаков
Масштабирование признаков для преобразования входных данных
Валидация путём проверки распределений по группам
Кодирование признаков
Оценка влияния кодирования на результаты
Проверка на предвзятость и потерю информации
Проверка на переобучение
Применение регуляризации и снижения размерности
Снижение размерности
Сокращение входных признаков с сохранением ключевой информации
Может вносить предвзятость
Используйте методы с учётом справедливости, например t-SNE
Финансовый советник
Признаки «Годовой доход» и «Частота инвестиций»
Корректировка выбросов и масштабирование
Анализ подгрупп
Давайте потренируемся!
Ответственное управление данными в ИИ
Preparing Video For Download...