Predikce dat v čase

Machine Learning pro data časových řad v Pythonu

Chris Holdgraf

Fellow, Berkeley Institute for Data Science

Klasifikace vs. regrese

Klasifikace
classification_model.predict(X_test)
array([0, 1, 1, 0])
Regrese
regression_model.predict(X_test)
array([0.2, 1.4, 3.6, 0.6])
Machine Learning pro data časových řad v Pythonu

Korelace a regrese

  • Regrese je podobná výpočtu korelace, ale s klíčovými rozdíly
    • Regrese: Proces vedoucí k formálnímu modelu dat
    • Korelace: Statistika popisující data. Méně informací než regresní model.
Machine Learning pro data časových řad v Pythonu

Korelace mezi proměnnými se v čase často mění

  • Časové řady mají vzory, které se v čase mění
  • Dvě zdánlivě korelované časové řady nemusí být korelované trvale
Machine Learning pro data časových řad v Pythonu

Vizualizace vztahů mezi časovými řadami

fig, axs = plt.subplots(1, 2)

# Make a line plot for each timeseries
axs[0].plot(x, c='k', lw=3, alpha=.2)
axs[0].plot(y)
axs[0].set(xlabel='time', title='X values = time')

# Encode time as color in a scatterplot
axs[1].scatter(x_long, y_long, c=np.arange(len(x_long)), cmap='viridis')
axs[1].set(xlabel='x', ylabel='y', title='Color = time')
Machine Learning pro data časových řad v Pythonu

Vizualizace dvou časových řad

Machine Learning pro data časových řad v Pythonu

Regresní modely v scikit-learn

from sklearn.linear_model import LinearRegression
model = LinearRegression()
model.fit(X, y)
model.predict(X)
Machine Learning pro data časových řad v Pythonu

Vizualizace predikcí v scikit-learn

alphas = [.1, 1e2, 1e3]
ax.plot(y_test, color='k', alpha=.3, lw=3)
for ii, alpha in enumerate(alphas):
    y_predicted = Ridge(alpha=alpha).fit(X_train, y_train).predict(X_test)
    ax.plot(y_predicted, c=cmap(ii / len(alphas)))
ax.legend(['True values', 'Model 1', 'Model 2', 'Model 3'])
ax.set(xlabel="Time")
Machine Learning pro data časových řad v Pythonu

Vizualizace predikcí v scikit-learn

Machine Learning pro data časových řad v Pythonu

Hodnocení regresních modelů

  • Dvě nejběžnější metody:
    • Korelace ($r$)
    • Koeficient determinace ($R^2$)
Machine Learning pro data časových řad v Pythonu

Koeficient determinace ($R^2$)

  • $R^2$ je shora omezeno hodnotou 1, zdola může být libovolně nízké
  • Hodnoty blízké 1 znamenají lepší predikce modelu

$$ 1 - \frac{error(model)}{variance(testdata)} $$

Machine Learning pro data časových řad v Pythonu

$R^2$ v scikit-learn

from sklearn.metrics import r2_score
print(r2_score(y_predicted, y_test))
0.08
Machine Learning pro data časových řad v Pythonu

Pojďme si procvičit!

Machine Learning pro data časových řad v Pythonu

Preparing Video For Download...