Опрацювання ознак у PySpark
John Hogue
Lead Data Scientist, General Mills
Збір даних
Правила зберігання даних
Обʼєднання різнорідних даних
Навмисні пропуски

Пропущені повністю навмання
Пропущені навмання
Пропущені не навмання
Коли видаляти рядки з пропусками?
isNull()
df.where(df['ROOF'].isNull()).count()
765
# Import library import seaborn as sns# subset the dataframe sub_df = df.select(['ROOMAREA1'])# sample the dataframe sample_df = sub_df.sample(False, .5, 4)# Convert to Pandas DataFrame pandas_df = sample_df.toPandas()# Plot it sns.heatmap(data=pandas_df.isnull())

Процес заміни пропусків
На основі правил
На основі статистики
Модельний підхід
** fillna(value, subset=None)
value — чим замінити пропускиsubset — список стовпців для заміни пропусків# Заміна пропусків нулем
df.fillna(0, subset=['DAYSONMARKET'])
# Заміна середнім значенням стовпця
col_mean = df.agg({'DAYSONMARKET': 'mean'}).collect()[0][0]
df.fillna(col_mean, subset=['DAYSONMARKET'])
Опрацювання ознак у PySpark