Skapa särdrag över tid

Maskininlärning för tidsseriedata i Python

Chris Holdgraf

Fellow, Berkeley Institute for Data Science

Extrahera särdrag med fönster

Maskininlärning för tidsseriedata i Python

Använda .aggregate för särdragsextraktion

# Visualize the raw data
print(prices.head(3))
symbol            AIG        ABT
date                            
2010-01-04  29.889999  54.459951
2010-01-05  29.330000  54.019953
2010-01-06  29.139999  54.319953
# Calculate a rolling window, then extract two features
feats = prices.rolling(20).aggregate([np.std, np.max]).dropna()
print(feats.head(3))
                 AIG                  ABT           
                 std       amax       std       amax
date                                                
2010-02-01  2.051966  29.889999  0.868830  56.239949
2010-02-02  2.101032  29.629999  0.869197  56.239949
2010-02-03  2.157249  29.629999  0.852509  56.239949
Maskininlärning för tidsseriedata i Python

Kontrollera egenskaperna hos dina särdrag!

Maskininlärning för tidsseriedata i Python

Använda partial() i Python

# If we just take the mean, it returns a single value
a = np.array([[0, 1, 2], [0, 1, 2], [0, 1, 2]])
print(np.mean(a))
1.0
# We can use the partial function to initialize np.mean 
# with an axis parameter
from functools import partial
mean_over_first_axis = partial(np.mean, axis=0)

print(mean_over_first_axis(a))
[0. 1. 2.]
Maskininlärning för tidsseriedata i Python

Percentiler sammanfattar dina data

  • Percentiler är ett effektivt sätt att få mer detaljerade sammanfattningar av dina data (till skillnad från np.mean)
  • För en given datamängd är den N:te percentilen det värde där N % av datan ligger under den datapunkten och 100–N % ligger över.
print(np.percentile(np.linspace(0, 200), q=20))
40.0
Maskininlärning för tidsseriedata i Python

Kombinera np.percentile() med delfunktioner för att beräkna ett intervall av percentiler

data = np.linspace(0, 100)

# Create a list of functions using a list comprehension
percentile_funcs = [partial(np.percentile, q=ii) for ii in [20, 40, 60]]

# Calculate the output of each function in the same way
percentiles = [i_func(data) for i_func in percentile_funcs]
print(percentiles)
[20.0, 40.00000000000001, 60.0]
# Calculate multiple percentiles of a rolling window
data.rolling(20).aggregate(percentiles)
Maskininlärning för tidsseriedata i Python

Beräkna "datumbaserade" särdrag

  • Hittills har vi fokuserat på att beräkna "statistiska" särdrag – sådana som motsvarar statistiska egenskaper hos datan, som "medelvärde", "standardavvikelse" och liknande
  • Glöm dock inte att tidsseriedata ofta har mer "mänskliga" särdrag, till exempel veckodag, helgdagar och liknande.
  • Dessa särdrag är ofta användbara när man arbetar med tidsseriedata som sträcker sig över flera år (som aktiekurser över tid)
Maskininlärning för tidsseriedata i Python

Datetime-särdrag med Pandas

# Ensure our index is datetime
prices.index = pd.to_datetime(prices.index)

# Extract datetime features
day_of_week_num = prices.index.weekday
print(day_of_week_num[:10])
Index([0 1 2 3 4 0 1 2 3 4], dtype='object')
day_of_week = prices.index.day_name()
print(day_of_week[:10])
Index(['Monday' 'Tuesday' 'Wednesday' 'Thursday' 'Friday' 'Monday' 'Tuesday'
 'Wednesday' 'Thursday' 'Friday'], dtype='object')
Maskininlärning för tidsseriedata i Python

Nu kör vi en övning!

Maskininlärning för tidsseriedata i Python

Preparing Video For Download...