PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
यूज़र-डिफ़ाइंड फंक्शंस या UDFs
pyspark.sql.functions.udf method के जरिए wrap किया गयाएक Python method परिभाषित करें
def reverseString(mystr):
return mystr[::-1]
फंक्शन को wrap करें और वैरिएबल में सेव करें
udfReverseString = udf(reverseString, StringType())
Spark के साथ उपयोग करें
user_df = user_df.withColumn('ReverseName',
udfReverseString(user_df.Name))
def sortingCap():
return random.choice(['G', 'H', 'R', 'S'])
udfSortingCap = udf(sortingCap, StringType())
user_df = user_df.withColumn('Class', udfSortingCap())
| Name | Age | Class |
|---|---|---|
| Alice | 14 | H |
| Bob | 18 | S |
| Candice | 63 | G |
PySpark के साथ डेटा क्लीनिंग