Vérifications de la qualité des données et statistiques sommaires

Surveiller le Machine Learning en Python

Hakim Elakhrass

Co-founder and CEO of NannyML

Que sont les vérifications de qualité et les statistiques sommaires ?

L'illustration montre le flux de surveillance avec la section « vérifications de la qualité des données » et « statistiques sommaires » mise en évidence dans l'étape d'analyse automatisée des causes profondes.

  • Détection des valeurs manquantes
  • Repérage des valeurs inédites
  • Somme, moyenne, écart type, médiane et nombre de lignes
Surveiller le Machine Learning en Python

Détection des valeurs manquantes

  • Moins d'observations dans un bloc
  • Perte d'information utile
  • Interprétations et décisions erronées
# Instantiate the missing values calculator module
ms_calc = nannyml.MissingValuesCalculator(column_names=["Age"], normalize=True)

# Fit the calculator on the reference set
ms_calc.fit(reference)

# Calculate the rate of the missing values on the analysis set
ms_results = ms_calc.calculate(analysis)
ms_results.plot()
Surveiller le Machine Learning en Python

Graphique des valeurs manquantes

Le graphique présente les résultats de valeurs manquantes avec le paramètre normalize à True et False.

Surveiller le Machine Learning en Python

Détection des valeurs inédites

  • Valeurs d'une caractéristique catégorielle absentes pendant la période de référence
  • Une hausse des valeurs inédites peut réduire la confiance du modèle dans certaines zones
# Instantiate the unseen values calculator module
us_calc = nannyml.UnseenValuesCalculator(column_names=["Cabin"], normalize=False)
# Fit, calculate and plot the rate of the unseen values
us_calc.fit(reference)
us_results = us_calc.calculate(analysis)
us_results.plot()

L'image montre un graphique des valeurs inédites avec des changements du nombre de valeurs inédites.

Surveiller le Machine Learning en Python

Statistiques sommaires

  • Somme : utile en finance pour calculer les revenus ou les profits d'une période.
  • Moyenne et écart type : utiles pour vérifier la dérive des données et l'explicabilité.
  • Médiane : résistante aux valeurs aberrantes, pratique quand une caractéristique en comporte beaucoup.
  • Nombre de lignes : permet de vérifier qu'il y a assez de données par bloc.
sum_calc = nannyml.SummaryStatsSumCalculator(column_names=selected_columns)
avg_calc = nannyml.SummaryStatsAvgCalculator(column_names=selected_columns)
std_calc = nannyml.SummaryStatsStdCalculator(column_names=selected_columns)
med_calc = nannyml.SummaryStatsMedianCalculator(column_names=selected_columns)
rows_calc = nannyml.SummaryStatsRowCountCalculator(column_names=selected_columns)
Surveiller le Machine Learning en Python

Passons à la pratique !

Surveiller le Machine Learning en Python

Preparing Video For Download...