Machine Learning pour les données chronologiques en Python
Chris Holdgraf
Fellow, Berkeley Institute for Data Science
# Itérer sur la méthode "split" retourne les indices entraînement/test
for tr, tt in cv.split(X, y):
model.fit(X[tr], y[tr])
model.score(X[tt], y[tt])
KFold divise vos données en plusieurs « plis » de taille égaleC'est l'une des méthodes de validation croisée les plus courantes
from sklearn.model_selection import KFold
cv = KFold(n_splits=5)
for tr, tt in cv.split(X, y):
...
fig, axs = plt.subplots(2, 1)
# Tracer les indices choisis pour la validation à chaque boucle
axs[0].scatter(tt, [0] * len(tt), marker='_', s=2, lw=40)
axs[0].set(ylim=[-.1, .1], title='Indices de l'ensemble de test (couleur=boucle de VC)',
xlabel='Indice des données brutes')
# Tracer les prédictions du modèle à chaque itération
axs[1].plot(model.predict(X[tt]))
axs[1].set(title='Prédictions de test à chaque boucle de VC',
xlabel='Indice de prédiction')

Il ne faut pas mélanger vos données pour prédire avec des séries chronologiques.
from sklearn.model_selection import ShuffleSplit
cv = ShuffleSplit(n_splits=3)
for tr, tt in cv.split(X, y):
...

# Importer et initialiser l'itérateur de validation croisée
from sklearn.model_selection import TimeSeriesSplit
cv = TimeSeriesSplit(n_splits=10)
fig, ax = plt.subplots(figsize=(10, 5))
for ii, (tr, tt) in enumerate(cv.split(X, y)):
# Tracer les indices d'entraînement et de test
l1 = ax.scatter(tr, [ii] * len(tr), c=[plt.cm.coolwarm(.1)],
marker='_', lw=6)
l2 = ax.scatter(tt, [ii] * len(tt), c=[plt.cm.coolwarm(.9)],
marker='_', lw=6)
ax.set(ylim=[10, -1], title='Comportement de TimeSeriesSplit',
xlabel='indice des données', ylabel='Itération de VC')
ax.legend([l1, l2], ['Entraînement', 'Validation'])

def myfunction(estimator, X, y):
y_pred = estimator.predict(X)
my_custom_score = my_custom_function(y_pred, y)
return my_custom_score
def my_pearsonr(est, X, y):
# Générer des prédictions et convertir en vecteur
y_pred = est.predict(X).squeeze()
# Utiliser la fonction numpy "corrcoef" pour calculer une matrice de corrélation
my_corrcoef_matrix = np.corrcoef(y_pred, y.squeeze())
# Retourner une seule valeur de corrélation de la matrice
my_corrcoef = my_corrcoef[1, 0]
return my_corrcoef
Machine Learning pour les données chronologiques en Python