PySpark के साथ Feature Engineering
John Hogue
Lead Data Scientist, General Mills
df.describe(['LISTPRICE']).show()
+-------+------------------+
|summary| LISTPRICE|
+-------+------------------+
| count| 5000|
| mean| 263419.365|
| stddev|143944.10818036905|
| min| 100000|
| max| 99999|
+-------+------------------+
pyspark.sql.functions.mean(col)pyspark.sql.functions.skewness(col)pyspark.sql.functions.min(col)cov(col1, col2)corr(col1, col2)mean(col)df.agg({'SALESCLOSEPRICE': 'mean'}).collect()
[Row(avg(SALESCLOSEPRICE)=262804.4668)]
cov(col1, col2)df.cov('SALESCLOSEPRICE', 'YEARBUILT')
1281910.3840634783

Seaborn जैसी स्टैंडर्ड लाइब्रेरी से PySpark DataFrames प्लॉट करने के लिए Pandas में कन्वर्शन चाहिए
WARNING: Pandas में कन्वर्ट करने से पहले PySpark DataFrames का सैंपल लें!
sample(withReplacement, fraction, seed=None)withReplacement सैंपल में रिपीट की अनुमतिfraction रखने वाले रिकॉर्ड्स का %seed पुनरुत्पादनयोग्यता के लिए रैंडम सीड# PySpark DataFrame का 50% सैंपल लें और पंक्तियाँ गिनें
df.sample(False, 0.5, 42).count()
2504
Seaborn distplot()
seaborn.distplot(a)a : Series, 1d-array, या list. Observed data.# अपनी पसंदीदा विज़ुअलाइज़ेशन लाइब्रेरी इम्पोर्ट करें import seaborn as sns# डेटाफ़्रेम को सैंपल करें sample_df = df.select(['SALESCLOSEPRICE']).sample(False, 0.5, 42)# सैंपल को Pandas DataFrame में कन्वर्ट करें pandas_df = sample_df.toPandas()# प्लॉट करें sns.distplot(pandas_df)

Seaborn lmplot()
seaborn.lmplot(x, y, data)x, y : स्ट्रिंग्स, इनपुट वैरिएबल; ये data में कॉलम नाम होने चाहिए.data : Pandas DataFrame# अपनी पसंदीदा विज़ुअलाइज़ेशन लाइब्रेरी इम्पोर्ट करें import seaborn as sns# कॉलम चुनें s_df = df.select(['SALESCLOSEPRICE', 'SQFTABOVEGROUND']) # डेटाफ़्रेम का सैंपल लें s_df = s_df.sample(False, 0.5, 42)# Pandas DataFrame में कन्वर्ट करें pandas_df = s_df.toPandas()# प्लॉट करें sns.lmplot(x='SQFTABOVEGROUND', y='SALESCLOSEPRICE', data=pandas_df)

PySpark के साथ Feature Engineering