時間序列之間的關係:相關性

Manipulating Time Series Data in Python

Stefan Jansen

Founder & Lead Data Scientist at Applied Artificial Intelligence

相關性與序列間關係

  • 目前為止:重點在單一變數的特性
  • 接下來:變數之間關係的特性
  • 相關性:衡量線性關係
  • 金融市場:有助於預測與風險管理
  • pandasseaborn 可計算並視覺化
Manipulating Time Series Data in Python

相關性與線性關係

  • 相關係數:兩變數繞其平均的共同變動有多相似?
  • 介於 -1+1 之間 $\ \ \ \ \ r = \frac{\sum_{i=1}^{N} (x_i - \bar{x})(y_i - \bar{y})}{s_xs_y}$

 

ch3_4_v2 - Correlation & Heatmaps.011.png

Manipulating Time Series Data in Python

匯入五個價格時間序列

data = pd.read_csv('assets.csv', parse_dates=['date'], 
                   index_col='date')

data = data.dropna().info()
DatetimeIndex: 2469 entries, 2007-05-25 to 2017-05-22
Data columns (total 5 columns):
sp500     2469 non-null float64
nasdaq    2469 non-null float64
bonds     2469 non-null float64
gold      2469 non-null float64
oil       2469 non-null float64
Manipulating Time Series Data in Python

視覺化成對線性關係

daily_returns = data.pct_change()

sns.jointplot(x='sp500', y='nasdaq', data=data_returns);

ch3_4_v2 - Correlation & Heatmaps.015.png

Manipulating Time Series Data in Python

計算所有相關性

correlations = returns.corr()

correlations
bonds       oil      gold     sp500    nasdaq
bonds   1.000000 -0.183755  0.003167 -0.300877 -0.306437
oil    -0.183755  1.000000  0.105930  0.335578  0.289590
gold    0.003167  0.105930  1.000000 -0.007786 -0.002544
sp500  -0.300877  0.335578 -0.007786  1.000000  0.959990
nasdaq -0.306437  0.289590 -0.002544  0.959990  1.000000
Manipulating Time Series Data in Python

視覺化所有相關性

sns.heatmap(correlations, annot=True)

ch3_4_v2 - Correlation & Heatmaps.019.png

Manipulating Time Series Data in Python

一起來練習吧!

Manipulating Time Series Data in Python

Preparing Video For Download...