Kontrola jakości danych i statystyki opisowe

Monitorowanie uczenia maszynowego w Pythonie

Hakim Elakhrass

Co-founder and CEO of NannyML

Czym są kontrola jakości danych i statystyki opisowe?

Obraz przedstawia przepływ pracy monitorowania z wyróżnionym etapem kontroli jakości danych i statystyk opisowych w automatycznej analizie przyczyn źródłowych.

  • Wykrywanie brakujących wartości
  • Wykrywanie nieznanych wartości
  • Suma, średnia, odchylenie standardowe, mediana i liczba wierszy
Monitorowanie uczenia maszynowego w Pythonie

Wykrywanie brakujących wartości

  • Mniejsza liczba obserwacji w fragmencie
  • Utrata cennych informacji
  • Błędne interpretacje i decyzje
# Instantiate the missing values calculator module
ms_calc = nannyml.MissingValuesCalculator(column_names=["Age"], normalize=True)

# Fit the calculator on the reference set
ms_calc.fit(reference)

# Calculate the rate of the missing values on the analysis set
ms_results = ms_calc.calculate(analysis)
ms_results.plot()
Monitorowanie uczenia maszynowego w Pythonie

Wykres brakujących wartości

Wykres przedstawia wyniki analizy brakujących wartości dla parametru normalize ustawionego na True i False.

Monitorowanie uczenia maszynowego w Pythonie

Wykrywanie nieznanych wartości

  • Wartości cech kategorycznych nieobecne w okresie referencyjnym
  • Wzrost liczby nieznanych wartości może obniżyć pewność modelu w danych obszarach
# Instantiate the unseen values calculator module
us_calc = nannyml.UnseenValuesCalculator(column_names=["Cabin"], normalize=False)
# Fit, calculate and plot the rate of the unseen values
us_calc.fit(reference)
us_results = us_calc.calculate(analysis)
us_results.plot()

Obraz przedstawia wykres nieznanych wartości ze zmianami w ich liczbie.

Monitorowanie uczenia maszynowego w Pythonie

Statystyki opisowe

  • Suma: Przydatna w danych finansowych do obliczania przychodów lub zysków za dany okres.
  • Średnia i odchylenie standardowe: Pomocne przy wykrywaniu dryftu danych i wyjaśnialności.
  • Mediana: Odporna na wartości odstające – przydatna dla cech z wieloma ekstremalnymi wartościami.
  • Liczba wierszy: Określa, czy w każdym fragmencie jest wystarczająco dużo danych.
sum_calc = nannyml.SummaryStatsSumCalculator(column_names=selected_columns)
avg_calc = nannyml.SummaryStatsAvgCalculator(column_names=selected_columns)
std_calc = nannyml.SummaryStatsStdCalculator(column_names=selected_columns)
med_calc = nannyml.SummaryStatsMedianCalculator(column_names=selected_columns)
rows_calc = nannyml.SummaryStatsRowCountCalculator(column_names=selected_columns)
Monitorowanie uczenia maszynowego w Pythonie

Czas na ćwiczenia!

Monitorowanie uczenia maszynowego w Pythonie

Preparing Video For Download...