Čištění a vylepšování dat

Machine Learning pro data časových řad v Pythonu

Chris Holdgraf

Fellow, Berkeley Institute for Data Science

Data jsou neuspořádaná

  • Reálná data jsou často neuspořádaná
  • Nejčastějšími problémy jsou chybějící data a odlehlé hodnoty
  • Příčinou bývá lidská chyba, selhání senzoru, výpadek databáze apod.
  • Vizualizace surových dat pomáhá tyto problémy odhalit
Machine Learning pro data časových řad v Pythonu

Jak vypadají neuspořádaná data

Machine Learning pro data časových řad v Pythonu

Interpolace: doplnění chybějících dat pomocí času

  • Běžným způsobem, jak řešit chybějící data, je interpolace chybějících hodnot
  • U časových řad lze při interpolaci využít čas.
  • Interpolace zde znamená použití known hodnot na obou stranách mezery k odhadu chybějících hodnot.
Machine Learning pro data časových řad v Pythonu

Interpolace v Pandas

# Return a boolean that notes where missing values are
missing = prices.isna()

# Interpolate linearly within missing windows
prices_interp = prices.interpolate('linear')

# Plot the interpolated data in red and the data w/ missing values in black
ax = prices_interp.plot(c='r')
prices.plot(c='k', ax=ax, lw=2)
Machine Learning pro data časových řad v Pythonu

Vizualizace interpolovaných dat

Machine Learning pro data časových řad v Pythonu

Transformace dat pomocí klouzavého okna

  • Klouzavá okna lze využít také k transformaci dat
  • Již jsme to jednou udělali – ke vyhlazení dat
  • Lze je použít i pro složitější transformace
Machine Learning pro data časových řad v Pythonu

Transformace dat pro standardizaci rozptylu

  • Standardizace průměru a rozptylu v čase je běžná transformace – existuje mnoho způsobů.
  • Ukážeme, jak převést datovou sadu tak, aby každý bod představoval % změnu oproti předchozímu oknu.
  • Časové body jsou pak lépe srovnatelné, pokud se absolutní hodnoty výrazně mění
Machine Learning pro data časových řad v Pythonu

Transformace na procentuální změnu v Pandas

def percent_change(values):
    """Calculates the % change between the last value 
    and the mean of previous values"""
    # Separate the last value and all previous values into variables
    previous_values = values[:-1]
    last_value = values[-1]

    # Calculate the % difference between the last value 
    # and the mean of earlier values
    percent_change = (last_value - np.mean(previous_values)) \
    / np.mean(previous_values)
    return percent_change
Machine Learning pro data časových řad v Pythonu

Aplikace na naše data

# Plot the raw data
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
ax = prices.plot(ax=axs[0])

# Calculate % change and plot
ax = prices.rolling(window=20).aggregate(percent_change).plot(ax=axs[1])
ax.legend_.set_visible(False)

Machine Learning pro data časových řad v Pythonu

Hledání odlehlých hodnot v datech

  • Odlehlé hodnoty jsou datové body statisticky výrazně odlišné od zbytku dat.
  • Mohou negativně ovlivnit predikční schopnost modelu a odchýlit ho od „skutečné" hodnoty
  • Řešením je odlehlé hodnoty odstranit nebo nahradit reprezentativnější hodnotou

Buďte velmi opatrní – bývá obtížné rozlišit legitimně extrémní hodnotu od anomálie

Machine Learning pro data časových řad v Pythonu

Vykreslení prahu v datech

fig, axs = plt.subplots(1, 2, figsize=(10, 5))
for data, ax in zip([prices, prices_perc_change], axs):
    # Calculate the mean / standard deviation for the data
    this_mean = data.mean()
    this_std = data.std()

    # Plot the data, with a window that is 3 standard deviations 
    # around the mean
    data.plot(ax=ax)
    ax.axhline(this_mean + this_std * 3, ls='--', c='r')
    ax.axhline(this_mean - this_std * 3, ls='--', c='r')
Machine Learning pro data časových řad v Pythonu

Vizualizace prahů odlehlých hodnot

Machine Learning pro data časových řad v Pythonu

Nahrazení odlehlých hodnot pomocí prahu

# Center the data so the mean is 0
prices_outlier_centered = prices_outlier_perc - prices_outlier_perc.mean()

# Calculate standard deviation
std = prices_outlier_perc.std()

# Use the absolute value of each datapoint 
# to make it easier to find outliers
outliers = np.abs(prices_outlier_centered) > (std * 3)

# Replace outliers with the median value
# We'll use np.nanmean since there may be nans around the outliers
prices_outlier_fixed = prices_outlier_centered.copy()
prices_outlier_fixed[outliers] = np.nanmedian(prices_outlier_fixed)

Machine Learning pro data časových řad v Pythonu

Vizualizace výsledků

fig, axs = plt.subplots(1, 2, figsize=(10, 5))
prices_outlier_centered.plot(ax=axs[0])
prices_outlier_fixed.plot(ax=axs[1])

Machine Learning pro data časových řad v Pythonu

Pojďme si procvičit!

Machine Learning pro data časových řad v Pythonu

Preparing Video For Download...