Elegir el algoritmo

Ingeniería de características con PySpark

John Hogue

Lead Data Scientist, General Mills

Panorama de Spark ML

Diagrama de ML

Ingeniería de características con PySpark

Panorama de Spark ML

Diagrama de ML

Ingeniería de características con PySpark

Panorama de Spark ML

Diagrama de ML

Ingeniería de características con PySpark

Panorama de Spark ML

Diagrama de ML

Ingeniería de características con PySpark

Métodos de regresión en PySpark

Métodos en ml.regression:

  • GeneralizedLinearRegression
  • IsotonicRegression
  • LinearRegression

 

  • DecisionTreeRegression
  • GBTRegression
  • RandomForestRegression
Ingeniería de características con PySpark

Métodos de regresión en PySpark

Métodos en ml.regression:

  • GeneralizedLinearRegression
  • IsotonicRegression
  • LinearRegression

 

  • DecisionTreeRegression
  • GBTRegression
  • RandomForestRegression
Ingeniería de características con PySpark

Diagrama RFR

Ingeniería de características con PySpark

División train/test en series temporales

Ingeniería de características con PySpark

División train/test en series temporales

# Create variables for max and min dates in our dataset
max_date = df.agg({'OFFMKTDATE': 'max'}).collect()[0][0]
min_date = df.agg({'OFFMKTDATE': 'min'}).collect()[0][0]
# Find how many days our data spans
from pyspark.sql.functions import datediff
range_in_days = datediff(max_date, min_date)
# Find the date to split the dataset on
from pyspark.sql.functions import date_add
split_in_days = round(range_in_days * 0.8)
split_date = date_add(min_date, split_in_days)
# Split the data into 80% train, 20% test
train_df = df.where(df['OFFMKTDATE'] < split_date) 
test_df = df.where(df['OFFMKTDATE'] >= split_date)\
  .where(df['LISTDATE'] >= split_date)
Ingeniería de características con PySpark

¡Vamos a practicar!

Ingeniería de características con PySpark

Preparing Video For Download...