Intégration des données
Gestion responsable des données en AI
Maria Prokofieva
Lead ML engineer
Ce que nous verrons
Pourquoi l'intégration est nécessaire
Ses avantages et ses écueils
Étapes de l'intégration des données
Pourquoi plusieurs sources ?
Vue détaillée et globale
Filet de sécurité
Diversité et équité des données
Explicabilité, transparence et imputabilité
Attention aux problèmes
Compromettre la qualité des données
Introduire des incohérences
Amplifier les biais
Réduire la représentativité
Complexifier le modèle
Moins de transparence et d'explicabilité
1
Image par Streamline HQ
Étape 1. Sélection des sources de données
Suivre les étapes d'évaluation
Évaluer les sources de données
Ensemble de données plus équilibré et complet
Étape 2. Aligner les types de données
Repérer les variables communes
Normaliser noms et formats
Normaliser les données numériques
Consolider les données catégorielles
Aligner la granularité
Étape 3. Améliorer biais et représentativité
Pondération
Connaissance du domaine
Attribuer des poids aux groupes sous/surreprésentés
Équilibrage
Représentation égale
Suréchantillonnage ou sous-échantillonnage
Vérifications algorithmiques
Analyse des écarts
Étape 4. Documenter
Dossiers détaillés :
Étapes d'intégration des données
Décisions prises
Métadonnées détaillées :
Sources de données
Méthodologie de collecte
Transformations appliquées
Projet : circulation urbaine
Sélectionner les sources de données
Repérer les caractéristiques communes
Élaborer un modèle de données unifié
1
Images par Streamline HQ
Projet : circulation urbaine
Utiliser des techniques statistiques pour les biais et la représentativité
Appliquer des ajustements de pondération
Analyse des écarts et repondération
Documenter
Passons à la pratique !
Gestion responsable des données en AI
Preparing Video For Download...