Remarques finales

Traitement des données manquantes par imputation dans R

Michal Oleszak

Machine Learning Engineer

Ce que vous savez

Chapitre 1 : Le problème des données manquantes :

  • La modélisation de données incomplètes exige un traitement particulier.
  • Les 3 mécanismes de données manquantes : MCAR, MAR et MNAR.
  • Les visualisations et tests statistiques révèlent les profils de données manquantes.

Chapitre 2 : Imputation par donneur :

  • L'imputation par la moyenne est généralement un mauvais choix.
  • Imputation « hot‑deck ».
  • Imputation par k plus proches voisins (kNN).
Traitement des données manquantes par imputation dans R

Ce que vous savez

Chapitre 3 : Imputation fondée sur un modèle

  • Boucler sur les variables et les imputer jusqu'à convergence.
  • Reproduire la variabilité en tirant des distributions conditionnelles.
  • Imputation par arbres avec forêts aléatoires.

Chapitre 4 : Incertitude due à l'imputation

  • Imputation multiple par bootstrap.
  • Imputation multiple avec MICE.
Traitement des données manquantes par imputation dans R

Quelle méthode d'imputation choisir ?

Quelques repères :

  • Données massives ou exécution en temps réel en production ?

    Utilisez l'imputation hot‑deck.

  • Vous soupçonnez des relations précises entre variables (connaissance du domaine) ?

    Utilisez l'imputation fondée sur un modèle.

  • La vitesse n'est pas critique et les relations entre variables ne sont pas évidentes ?

    Utilisez l'imputation kNN ou par arbres.

Traitement des données manquantes par imputation dans R

Comment estimer l'incertitude due à l'imputation ?

Quelques repères :

  • Doit être relativement rapide ?
  • Vous savez quels modèles utiliser et comment les spécifier ?

Utilisez MICE.

  • Vous préférez une méthode non paramétrique (kNN, hot‑deck) ?
  • Vous ne voulez pas vous soucier des hypothèses de modèles précis ?

Utilisez le bootstrap.

Traitement des données manquantes par imputation dans R

Prochaines étapes

  • miceVignettes :

    • Imputation passive et post-traitement
    • Imputer des données multiniveaux
    • Analyse de sensibilité
  • S. van Buuren (2018). Flexible Imputation of Missing Data. Second Edition. CRC/Chapman & Hall, FL : Boca Raton.

  • Autres forfaits R : Amelia, mi

La couverture du livre « Flexible Imputation of Missing Data » de Stef van Buuren.

Traitement des données manquantes par imputation dans R

Félicitations et bonne chance !

Traitement des données manquantes par imputation dans R

Preparing Video For Download...