Feature Engineering cu PySpark
John Hogue
Lead Data Scientist, General Mills
Colectarea datelor
Reguli de stocare a datelor
Îmbinarea surselor disparate
Lipsă intenționată

Complet aleatoriu
Aleatoriu
Non-aleatoriu
Când se elimină rândurile cu date lipsă?
isNull()
df.where(df['ROOF'].isNull()).count()
765
# Import library import seaborn as sns# subset the dataframe sub_df = df.select(['ROOMAREA1'])# sample the dataframe sample_df = sub_df.sample(False, .5, 4)# Convert to Pandas DataFrame pandas_df = sample_df.toPandas()# Plot it sns.heatmap(data=pandas_df.isnull())

Procesul de înlocuire a valorilor lipsă
Bazat pe reguli
Bazat pe statistici
Bazat pe modele
** fillna(value, subset=None)
value valoarea cu care se înlocuiesc datele lipsăsubset lista coloanelor în care se înlocuiesc datele lipsă# Replacing missing values with zero
df.fillna(0, subset=['DAYSONMARKET'])
# Replacing with the mean value for that column
col_mean = df.agg({'DAYSONMARKET': 'mean'}).collect()[0][0]
df.fillna(col_mean, subset=['DAYSONMARKET'])
Feature Engineering cu PySpark