डेटा का दृश्य निरीक्षण

PySpark के साथ Feature Engineering

John Hogue

Lead Data Scientist, General Mills

DataFrame.describe() के साथ वर्णनात्मक आँकड़े

df.describe(['LISTPRICE']).show()
+-------+------------------+
|summary|         LISTPRICE|
+-------+------------------+
|  count|              5000|
|   mean|        263419.365|
| stddev|143944.10818036905|
|    min|            100000|
|    max|             99999|
+-------+------------------+
PySpark के साथ Feature Engineering

कई वर्णनात्मक फंक्शन पहले से उपलब्ध हैं

  • औसत (Mean)
    • pyspark.sql.functions.mean(col)
  • Skewness
    • pyspark.sql.functions.skewness(col)
  • न्यूनतम (Minimum)
    • pyspark.sql.functions.min(col)
  • सह-अन्तर (Covariance)
    • cov(col1, col2)
  • सहसंबंध (Correlation)
    • corr(col1, col2)
PySpark के साथ Feature Engineering

mean() के साथ उदाहरण

  • mean(col)
  • एग्रीगेट फंक्शन: ग्रुप के मूल्यों का औसत लौटाता है.
df.agg({'SALESCLOSEPRICE': 'mean'}).collect()
[Row(avg(SALESCLOSEPRICE)=262804.4668)]
PySpark के साथ Feature Engineering

cov() के साथ उदाहरण

  • cov(col1, col2)
  • Parameters:
    • col1 – पहला कॉलम
    • col2 – दूसरा कॉलम
df.cov('SALESCLOSEPRICE', 'YEARBUILT')
1281910.3840634783
PySpark के साथ Feature Engineering

seaborn: सांख्यिकीय डेटा विज़ुअलाइज़ेशन

Seaborn

PySpark के साथ Feature Engineering

प्लॉटिंग पर नोट्स

Seaborn जैसी स्टैंडर्ड लाइब्रेरी से PySpark DataFrames प्लॉट करने के लिए Pandas में कन्वर्शन चाहिए

WARNING: Pandas में कन्वर्ट करने से पहले PySpark DataFrames का सैंपल लें!

  • sample(withReplacement, fraction, seed=None)
    • withReplacement सैंपल में रिपीट की अनुमति
    • fraction रखने वाले रिकॉर्ड्स का %
    • seed पुनरुत्पादनयोग्यता के लिए रैंडम सीड
# PySpark DataFrame का 50% सैंपल लें और पंक्तियाँ गिनें
df.sample(False, 0.5, 42).count()
2504
PySpark के साथ Feature Engineering

डिस्ट्रिब्यूशन प्लॉट के लिए तैयारी

Seaborn distplot()

  • seaborn.distplot(a)
  • a : Series, 1d-array, या list. Observed data.
# अपनी पसंदीदा विज़ुअलाइज़ेशन लाइब्रेरी इम्पोर्ट करें
import seaborn as sns

# डेटाफ़्रेम को सैंपल करें sample_df = df.select(['SALESCLOSEPRICE']).sample(False, 0.5, 42)
# सैंपल को Pandas DataFrame में कन्वर्ट करें pandas_df = sample_df.toPandas()
# प्लॉट करें sns.distplot(pandas_df)
PySpark के साथ Feature Engineering

सेल्स क्लोज़िंग प्राइस का डिस्ट्रीब्यूशन प्लॉट

Displot

PySpark के साथ Feature Engineering

रिलेशनशिप प्लॉटिंग

Seaborn lmplot()

  • seaborn.lmplot(x, y, data)
  • x, y : स्ट्रिंग्स, इनपुट वैरिएबल; ये data में कॉलम नाम होने चाहिए.
  • data : Pandas DataFrame
# अपनी पसंदीदा विज़ुअलाइज़ेशन लाइब्रेरी इम्पोर्ट करें
import seaborn as sns

# कॉलम चुनें s_df = df.select(['SALESCLOSEPRICE', 'SQFTABOVEGROUND']) # डेटाफ़्रेम का सैंपल लें s_df = s_df.sample(False, 0.5, 42)
# Pandas DataFrame में कन्वर्ट करें pandas_df = s_df.toPandas()
# प्लॉट करें sns.lmplot(x='SQFTABOVEGROUND', y='SALESCLOSEPRICE', data=pandas_df)
PySpark के साथ Feature Engineering

SQFT above ground और सेल्स प्राइस के बीच लीनियर मॉडल प्लॉट

Linear Model Plot

PySpark के साथ Feature Engineering

अभ्यास करते हैं!

PySpark के साथ Feature Engineering

Preparing Video For Download...