Datakvalitetskontroller och sammanfattande statistik

Övervakning av maskininlärning i Python

Hakim Elakhrass

Co-founder and CEO of NannyML

Vad är datakvalitetskontroller och sammanfattande statistik?

Bilden visar ett övervakningsarbetsflöde med den markerade delen för datakvalitetskontroller och sammanfattande statistik i steget för automatiserad rotorsaksanalys.

  • Identifiering av saknade värden
  • Identifiering av okända värden
  • Summering, medelvärde, standardavvikelse, median och radantal
Övervakning av maskininlärning i Python

Identifiering av saknade värden

  • Färre observationer i ett segment
  • Förlust av värdefull information
  • Felaktiga tolkningar och beslut
# Instantiate the missing values calculator module
ms_calc = nannyml.MissingValuesCalculator(column_names=["Age"], normalize=True)

# Fit the calculator on the reference set
ms_calc.fit(reference)

# Calculate the rate of the missing values on the analysis set
ms_results = ms_calc.calculate(analysis)
ms_results.plot()
Övervakning av maskininlärning i Python

Diagram över saknade värden

Diagrammet visar resultat för saknade värden med parametern normalize satt till True respektive False.

Övervakning av maskininlärning i Python

Identifiering av okända värden

  • Kategoriska särdragsvärden som inte förekommer i referensperioden
  • Fler okända värden kan göra modellen mindre säker i vissa regioner
# Instantiate the unseen values calculator module
us_calc = nannyml.UnseenValuesCalculator(column_names=["Cabin"], normalize=False)
# Fit, calculate and plot the rate of the unseen values
us_calc.fit(reference)
us_results = us_calc.calculate(analysis)
us_results.plot()

Bilden visar ett diagram över okända värden med förändringar i antalet okända värden.

Övervakning av maskininlärning i Python

Sammanfattande statistik

  • Summering: Användbart för finansiell data för att beräkna intäkter eller vinst under en specifik period.
  • Medelvärde och standardavvikelse: Hjälpsamma vid kontroll av datadrift och förklarbarhet.
  • Median: Robust mot extremvärden – praktisk när särdrag har många avvikande värden.
  • Radantal: Avgör om det finns tillräckligt med data i varje segment.
sum_calc = nannyml.SummaryStatsSumCalculator(column_names=selected_columns)
avg_calc = nannyml.SummaryStatsAvgCalculator(column_names=selected_columns)
std_calc = nannyml.SummaryStatsStdCalculator(column_names=selected_columns)
med_calc = nannyml.SummaryStatsMedianCalculator(column_names=selected_columns)
rows_calc = nannyml.SummaryStatsRowCountCalculator(column_names=selected_columns)
Övervakning av maskininlärning i Python

Nu kör vi en övning!

Övervakning av maskininlärning i Python

Preparing Video For Download...