Kontroly kvality dat a souhrnné statistiky

Monitoring Machine Learning in Python

Hakim Elakhrass

Co-founder and CEO of NannyML

Co jsou kontroly kvality dat a souhrnné statistiky?

Obrázek ukazuje monitorovací pracovní postup se zvýrazněnou částí kontrol kvality dat a souhrnných statistik v kroku automatizované analýzy příčin.

  • Detekce chybějících hodnot
  • Detekce neznámých hodnot
  • Součet, průměr, směrodatná odchylka, medián a počty řádků
Monitoring Machine Learning in Python

Detekce chybějících hodnot

  • Snížený počet pozorování v bloku
  • Ztráta cenných informací
  • Nesprávné interpretace a rozhodnutí
# Instantiate the missing values calculator module
ms_calc = nannyml.MissingValuesCalculator(column_names=["Age"], normalize=True)

# Fit the calculator on the reference set
ms_calc.fit(reference)

# Calculate the rate of the missing values on the analysis set
ms_results = ms_calc.calculate(analysis)
ms_results.plot()
Monitoring Machine Learning in Python

Graf chybějících hodnot

Graf zobrazuje výsledky chybějících hodnot pro parametr normalize nastavený na True a False.

Monitoring Machine Learning in Python

Detekce neznámých hodnot

  • Hodnoty kategorického příznaku, které nejsou přítomny v referenčním období
  • Nárůst neznámých hodnot může snížit jistotu modelu v určitých oblastech
# Instantiate the unseen values calculator module
us_calc = nannyml.UnseenValuesCalculator(column_names=["Cabin"], normalize=False)
# Fit, calculate and plot the rate of the unseen values
us_calc.fit(reference)
us_results = us_calc.calculate(analysis)
us_results.plot()

Obrázek zobrazuje graf neznámých hodnot se změnami v jejich počtu.

Monitoring Machine Learning in Python

Souhrnné statistiky

  • Součet: Vhodný pro finanční data – výpočet příjmů nebo zisků za dané období.
  • Průměr a směrodatná odchylka: Užitečné pro detekci datového driftu a vysvětlitelnost.
  • Medián: Odolný vůči odlehlým hodnotám – vhodný pro příznaky s mnoha extrémními hodnotami.
  • Počty řádků: Zjistí, zda je v každém bloku dostatek dat.
sum_calc = nannyml.SummaryStatsSumCalculator(column_names=selected_columns)
avg_calc = nannyml.SummaryStatsAvgCalculator(column_names=selected_columns)
std_calc = nannyml.SummaryStatsStdCalculator(column_names=selected_columns)
med_calc = nannyml.SummaryStatsMedianCalculator(column_names=selected_columns)
rows_calc = nannyml.SummaryStatsRowCountCalculator(column_names=selected_columns)
Monitoring Machine Learning in Python

Lass uns üben!

Monitoring Machine Learning in Python

Preparing Video For Download...