Machine Learning pour les données chronologiques en Python
Chris Holdgraf
Fellow, Berkeley Institute for Data Science

# Indiquer par un booléen où les valeurs sont manquantes
missing = prices.isna()
# Interpoler linéairement dans les fenêtres manquantes
prices_interp = prices.interpolate('linear')
# Tracer les données interpolées en rouge et celles avec valeurs manquantes en noir
ax = prices_interp.plot(c='r')
prices.plot(c='k', ax=ax, lw=2)

def percent_change(values):
"""Calcule le % de variation entre la dernière valeur
et la moyenne des valeurs précédentes"""
# Séparer la dernière valeur et toutes les précédentes
previous_values = values[:-1]
last_value = values[-1]
# Calculer l'écart en % entre la dernière valeur
# et la moyenne des valeurs antérieures
percent_change = (last_value - np.mean(previous_values)) \
/ np.mean(previous_values)
return percent_change
# Tracer les données brutes
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
ax = prices.plot(ax=axs[0])
# Calculer le % de variation et tracer
ax = prices.rolling(window=20).aggregate(percent_change).plot(ax=axs[1])
ax.legend_.set_visible(False)

Soyez très prudent : il est souvent difficile de distinguer une valeur vraiment extrême d'une aberration.
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
for data, ax in zip([prices, prices_perc_change], axs):
# Calculer la moyenne et l'écart type
this_mean = data.mean()
this_std = data.std()
# Tracer les données et un seuil à 3 écarts types
# autour de la moyenne
data.plot(ax=ax)
ax.axhline(this_mean + this_std * 3, ls='--', c='r')
ax.axhline(this_mean - this_std * 3, ls='--', c='r')

# Centrer les données pour que la moyenne soit 0
prices_outlier_centered = prices_outlier_perc - prices_outlier_perc.mean()
# Calculer l'écart type
std = prices_outlier_perc.std()
# Utiliser la valeur absolue de chaque point
# pour repérer plus facilement les aberrations
outliers = np.abs(prices_outlier_centered) > (std * 3)
# Remplacer les aberrations par la médiane
# Utiliser np.nanmedian car il peut y avoir des NaN près des aberrations
prices_outlier_fixed = prices_outlier_centered.copy()
prices_outlier_fixed[outliers] = np.nanmedian(prices_outlier_fixed)
fig, axs = plt.subplots(1, 2, figsize=(10, 5))
prices_outlier_centered.plot(ax=axs[0])
prices_outlier_fixed.plot(ax=axs[1])

Machine Learning pour les données chronologiques en Python