Feature Engineering met PySpark
John Hogue
Lead Data Scientist, General Mills
Dataverzameling
Regels voor dataopslag
Verschillende data samenvoegen
Opzettelijk missend

Completely at random (MCAR)
Missing at random (MAR)
Not at random (MNAR)
Wanneer rijen met missende data droppen?
isNull()
df.where(df['ROOF'].isNull()).count()
765
# Bibliotheek importeren import seaborn as sns# subset van de dataframe sub_df = df.select(['ROOMAREA1'])# steekproef uit de dataframe sample_df = sub_df.sample(False, .5, 4)# Converteren naar Pandas DataFrame pandas_df = sample_df.toPandas()# Plotten sns.heatmap(data=pandas_df.isnull())

Proces om missende waarden te vervangen
Regelgebaseerd
Statistiekgebaseerd
Modelgebaseerd
** fillna(value, subset=None)
value de waarde om missers mee te vervangensubset de lijst met kolomnamen om missers te vervangen# Missende waarden vervangen door nul
df.fillna(0, subset=['DAYSONMARKET'])
# Vervangen door het gemiddelde van die kolom
col_mean = df.agg({'DAYSONMARKET': 'mean'}).collect()[0][0]
df.fillna(col_mean, subset=['DAYSONMARKET'])
Feature Engineering met PySpark