Перевірки якості даних і зведена статистика

Моніторинг Machine Learning у Python

Hakim Elakhrass

Co-founder and CEO of NannyML

Що таке перевірки якості даних і зведена статистика?

Зображено процес моніторингу з виділеними перевірками якості даних і зведеною статистикою на етапі автоматизованого аналізу першопричин.

  • Виявлення пропущених значень
  • Виявлення невідомих значень
  • Сума, середнє, стандартне відхилення, медіана та кількість рядків
Моніторинг Machine Learning у Python

Виявлення пропущених значень

  • Менше спостережень у блоці
  • Втрата цінної інформації
  • Хибні інтерпретації та рішення
# Instantiate the missing values calculator module
ms_calc = nannyml.MissingValuesCalculator(column_names=["Age"], normalize=True)

# Fit the calculator on the reference set
ms_calc.fit(reference)

# Calculate the rate of the missing values on the analysis set
ms_results = ms_calc.calculate(analysis)
ms_results.plot()
Моніторинг Machine Learning у Python

Графік пропущених значень

Графік показує результати пропусків для параметра normalize, встановленого на True і False.

Моніторинг Machine Learning у Python

Виявлення невідомих значень

  • Категоріальні значення ознаки, яких немає у референсному періоді
  • Зростання невідомих значень може знижувати впевненість моделі в окремих регіонах
# Instantiate the unseen values calculator module
us_calc = nannyml.UnseenValuesCalculator(column_names=["Cabin"], normalize=False)
# Fit, calculate and plot the rate of the unseen values
us_calc.fit(reference)
us_results = us_calc.calculate(analysis)
us_results.plot()

Зображено графік невідомих значень зі змінами їх кількості.

Моніторинг Machine Learning у Python

Зведена статистика

  • Сума: корисна для фінданих, щоб обчислювати виручку чи прибуток за період.
  • Середнє і стандартне відхилення: допомагають у перевірці дрейфу даних та пояснюваності.
  • Медіана: стійка до викидів, тож корисна, коли ознака має багато екстремальних значень.
  • Кількість рядків: визначає, чи достатньо даних у кожному блоці.
sum_calc = nannyml.SummaryStatsSumCalculator(column_names=selected_columns)
avg_calc = nannyml.SummaryStatsAvgCalculator(column_names=selected_columns)
std_calc = nannyml.SummaryStatsStdCalculator(column_names=selected_columns)
med_calc = nannyml.SummaryStatsMedianCalculator(column_names=selected_columns)
rows_calc = nannyml.SummaryStatsRowCountCalculator(column_names=selected_columns)
Моніторинг Machine Learning у Python

Давайте потренуємось!

Моніторинг Machine Learning у Python

Preparing Video For Download...