PySpark के साथ Big Data Fundamentals
Upendra Devisetty
Science Analyst, CyVerse
reduce(func) एक्शन का उपयोग सामान्य RDD के एलिमेंट्स को एग्रीगेट करने के लिए होता है
फंक्शन commutative होना चाहिए (ऑपरेन्ड्स का क्रम बदलने से परिणाम न बदले) और associative
PySpark में reduce() एक्शन का उदाहरण
x = [1,3,4,6]
RDD = sc.parallelize(x)
RDD.reduce(lambda x, y : x + y)
14
saveAsTextFile() एक्शन RDD को एक डायरेक्टरी में टेक्स्ट फाइलों के रूप में सेव करता है, जहाँ हर partition अलग फाइल होता हैRDD.saveAsTextFile("tempFile")
coalesce() मेथड से RDD को एक ही टेक्स्ट फाइल में सेव कर सकते हैंRDD.coalesce(1).saveAsTextFile("tempFile")
PySpark pair RDDs के लिए उपलब्ध RDD actions
Pair RDD actions, key-value डेटा का लाभ उठाते हैं
Pair RDD actions के कुछ उदाहरण
countByKey()
collectAsMap()
countByKey() सिर्फ टाइप (K, V) के लिए उपलब्ध है
countByKey() एक्शन हर key के लिए एलिमेंट्स की संख्या गिनता है
एक सरल लिस्ट पर countByKey() का उदाहरण
rdd = sc.parallelize([("a", 1), ("b", 1), ("a", 1)])
for kee, val in rdd.countByKey().items():
print(kee, val)
('a, 2)
('b', 1)
collectAsMap() RDD के key-value पेयर्स को dictionary के रूप में रिटर्न करता है
एक सरल tuple पर collectAsMap() का उदाहरण
sc.parallelize([(1, 2), (3, 4)]).collectAsMap()
{1: 2, 3: 4}
PySpark के साथ Big Data Fundamentals