Den Algorithmus wählen

Feature Engineering mit PySpark

John Hogue

Lead Data Scientist, General Mills

Spark-ML-Landschaft

ML-Flowchart

Feature Engineering mit PySpark

Spark-ML-Landschaft

ML-Flowchart

Feature Engineering mit PySpark

Spark-ML-Landschaft

ML-Flowchart

Feature Engineering mit PySpark

Spark-ML-Landschaft

ML-Flowchart

Feature Engineering mit PySpark

PySpark-Regression: Methoden

Methoden in ml.regression:

  • GeneralizedLinearRegression
  • IsotonicRegression
  • LinearRegression

 

  • DecisionTreeRegression
  • GBTRegression
  • RandomForestRegression
Feature Engineering mit PySpark

PySpark-Regression: Methoden

Methoden in ml.regression:

  • GeneralizedLinearRegression
  • IsotonicRegression
  • LinearRegression

 

  • DecisionTreeRegression
  • GBTRegression
  • RandomForestRegression
Feature Engineering mit PySpark

RFR-Diagramm

Feature Engineering mit PySpark

Train-/Test-Splits für Zeitreihen

Feature Engineering mit PySpark

Train-/Test-Splits für Zeitreihen

# Create variables for max and min dates in our dataset
max_date = df.agg({'OFFMKTDATE': 'max'}).collect()[0][0]
min_date = df.agg({'OFFMKTDATE': 'min'}).collect()[0][0]
# Find how many days our data spans
from pyspark.sql.functions import datediff
range_in_days = datediff(max_date, min_date)
# Find the date to split the dataset on
from pyspark.sql.functions import date_add
split_in_days = round(range_in_days * 0.8)
split_date = date_add(min_date, split_in_days)
# Split the data into 80% train, 20% test
train_df = df.where(df['OFFMKTDATE'] < split_date) 
test_df = df.where(df['OFFMKTDATE'] >= split_date)\
  .where(df['LISTDATE'] >= split_date)
Feature Engineering mit PySpark

Lass uns üben!

Feature Engineering mit PySpark

Preparing Video For Download...