PySpark के साथ Feature Engineering
John Hogue
Lead Data Scientist, General Mills
Data Collection
Data Storage Rules
Joining Disparate Data
Intentionally Missing

पूरी तरह रैंडम तरीके से मिसिंग
रैंडम तरीके से मिसिंग
रैंडम नहीं तरीके से मिसिंग
कब मिसिंग डेटा वाली पंक्तियाँ ड्रॉप करें?
isNull()
df.where(df['ROOF'].isNull()).count()
765
# Import library import seaborn as sns# subset the dataframe sub_df = df.select(['ROOMAREA1'])# sample the dataframe sample_df = sub_df.sample(False, .5, 4)# Convert to Pandas DataFrame pandas_df = sample_df.toPandas()# Plot it sns.heatmap(data=pandas_df.isnull())

मिसिंग वैल्यूज़ को बदलने की प्रक्रिया
रूल-आधारित
स्टैटिस्टिक्स-आधारित
मॉडल-आधारित
** fillna(value, subset=None)
value वह वैल्यू जिससे मिसिंग बदली जाएsubset वे कॉलम जिनमें मिसिंग बदली जाए# मिसिंग वैल्यूज़ को शून्य से बदलना
df.fillna(0, subset=['DAYSONMARKET'])
# उस कॉलम के mean से बदलना
col_mean = df.agg({'DAYSONMARKET': 'mean'}).collect()[0][0]
df.fillna(col_mean, subset=['DAYSONMARKET'])
PySpark के साथ Feature Engineering