Données manquantes : ce qui peut mal tourner

Traitement des données manquantes par imputation dans R

Michal Oleszak

Machine Learning Engineer

Ce que vous apprendrez

Une fois ce cours terminé, vous serez en mesure de :

  • Comprendre pourquoi les données manquantes exigent un traitement particulier.
  • Utiliser des tests statistiques et des outils de visualisation pour repérer des motifs de données manquantes.
  • Effectuer l'imputation avec divers modèles statistiques et de Machine Learning.
  • Intégrer l'incertitude due à l'imputation dans vos analyses et prédictions pour les rendre plus robustes.
Traitement des données manquantes par imputation dans R

Préalables

Ce cours suppose que vous êtes à l'aise avec les sujets suivants :

  • Manipulations de base des données avec dplyr et l'opérateur pipe (%>%).
  • Modèles de régression linéaire et logistique (lm(), glm()).
  • Notions de probabilité : variables aléatoires, distributions.
Traitement des données manquantes par imputation dans R

Introduction aux données manquantes

De toute évidence, la meilleure façon de traiter les données manquantes est de ne pas en avoir.

Malheureusement, elles sont partout :

  • Non-réponse dans les sondages.
  • Problèmes techniques avec l'équipement de collecte.
  • Fusion de données provenant de sources différentes.
  • ...

Il faut rester vigilant face aux données manquantes.

1 Orchard, T., et M. A. Woodbury. 1972. « A Missing Information Principle: Theory and Applications. » In Proceedings of the Sixth Berkeley Symposium on Mathematical Statistics and Probability, 1:697–715.
Traitement des données manquantes par imputation dans R

Données NHANES

head(nhanes, 3)
  Age Gender Weight Height Diabetes TotChol Pulse PhysActive
1  16   male   73.2  172.0    FALSE    3.00    76       TRUE
2  17   male   72.3  176.0    FALSE    2.61    74       TRUE
3  12   male   57.7  158.9    FALSE    4.27    80       TRUE
nhanes %>% is.na() %>% colSums()
Age     Gender     Weight     Height   Diabetes    TotChol    Pulse   PhysActive 
0       0          9          8        1            85        32      26
Traitement des données manquantes par imputation dans R

Régression linéaire avec des données incomplètes

model_1 <- lm(Diabetes ~ Age + Weight, 
              data = nhanes)

Extraits de summary(model_1) :

Residual standard error: 0.08571 on 804 
degrees of freedom (10 observations 
deleted due to missingness)

Adjusted R-squared:  0.005706 
F-statistic: 3.313 on 2 and 804 DF,  
p-value: 0.03691
model_2 <- lm(Diabetes ~ Age + Weight +
              TotChol, data = nhanes)

Extraits de summary(model_2) :

Residual standard error: 0.08264 on 718 
degrees of freedom (95 observations
deleted due to missingness)

Adjusted R-squared:  0.008422 
F-statistic: 3.041 on 3 and 718 DF,
p-value: 0.02834
Traitement des données manquantes par imputation dans R

Points clés

  • Les logiciels statistiques ignorent parfois les données manquantes sans avertir.
  • Il peut alors devenir impossible de comparer des modèles.
  • Écarter toutes les observations incomplètes peut biaiser les résultats.
  • Les données manquantes, si présentes, doivent être traitées adéquatement.
Traitement des données manquantes par imputation dans R

Passons à la pratique !

Traitement des données manquantes par imputation dans R

Preparing Video For Download...