Machine Learning per dati di serie temporali in Python
Chris Holdgraf
Fellow, Berkeley Institute for Data Science

# Restituisce un booleano che indica dove ci sono valori mancanti
missing = prices.isna()
# Interpola linearmente nelle finestre con dati mancanti
prices_interp = prices.interpolate('linear')
# Traccia i dati interpolati in rosso e quelli con mancanti in nero
ax = prices_interp.plot(c='r')
prices.plot(c='k', ax=ax, lw=2)

def percent_change(values):
"""Calcola la variazione % tra l'ultimo valore
e la media dei valori precedenti"""
# Separa l'ultimo valore e tutti i precedenti
previous_values = values[:-1]
last_value = values[-1]
# Calcola la differenza % tra l'ultimo valore
# e la media dei valori precedenti
percent_change = (last_value - np.mean(previous_values)) \
/ np.mean(previous_values)
return percent_change
# Traccia i dati grezzi
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
ax = prices.plot(ax=axs[0])
# Calcola la % di variazione e traccia
ax = prices.rolling(window=20).aggregate(percent_change).plot(ax=axs[1])
ax.legend_.set_visible(False)

Fai molta attenzione: spesso è difficile distinguere tra un valore davvero estremo e un'aberrazione
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
for data, ax in zip([prices, prices_perc_change], axs):
# Calcola media e deviazione standard
this_mean = data.mean()
this_std = data.std()
# Traccia i dati, con una soglia a 3 deviazioni standard
# attorno alla media
data.plot(ax=ax)
ax.axhline(this_mean + this_std * 3, ls='--', c='r')
ax.axhline(this_mean - this_std * 3, ls='--', c='r')

# Centra i dati in modo che la media sia 0
prices_outlier_centered = prices_outlier_perc - prices_outlier_perc.mean()
# Calcola la deviazione standard
std = prices_outlier_perc.std()
# Usa il valore assoluto di ogni punto
# per trovare più facilmente gli outlier
outliers = np.abs(prices_outlier_centered) > (std * 3)
# Sostituisci gli outlier con la mediana
# Usa np.nanmean perché potrebbero esserci nan attorno agli outlier
prices_outlier_fixed = prices_outlier_centered.copy()
prices_outlier_fixed[outliers] = np.nanmedian(prices_outlier_fixed)
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
prices_outlier_centered.plot(ax=axs[0])
prices_outlier_fixed.plot(ax=axs[1])

Machine Learning per dati di serie temporali in Python