More actions

PySpark के साथ Big Data Fundamentals

Upendra Devisetty

Science Analyst, CyVerse

reduce() action

  • reduce(func) एक्शन का उपयोग सामान्य RDD के एलिमेंट्स को एग्रीगेट करने के लिए होता है

  • फंक्शन commutative होना चाहिए (ऑपरेन्ड्स का क्रम बदलने से परिणाम न बदले) और associative

  • PySpark में reduce() एक्शन का उदाहरण

x = [1,3,4,6]
RDD = sc.parallelize(x)
RDD.reduce(lambda x, y : x + y)
14
PySpark के साथ Big Data Fundamentals

saveAsTextFile() action

  • saveAsTextFile() एक्शन RDD को एक डायरेक्टरी में टेक्स्ट फाइलों के रूप में सेव करता है, जहाँ हर partition अलग फाइल होता है
RDD.saveAsTextFile("tempFile")
  • coalesce() मेथड से RDD को एक ही टेक्स्ट फाइल में सेव कर सकते हैं
RDD.coalesce(1).saveAsTextFile("tempFile")
PySpark के साथ Big Data Fundamentals

Action operations on pair RDDs

  • PySpark pair RDDs के लिए उपलब्ध RDD actions

  • Pair RDD actions, key-value डेटा का लाभ उठाते हैं

  • Pair RDD actions के कुछ उदाहरण

    • countByKey()

    • collectAsMap()

PySpark के साथ Big Data Fundamentals

countByKey() action

  • countByKey() सिर्फ टाइप (K, V) के लिए उपलब्ध है

  • countByKey() एक्शन हर key के लिए एलिमेंट्स की संख्या गिनता है

  • एक सरल लिस्ट पर countByKey() का उदाहरण

rdd = sc.parallelize([("a", 1), ("b", 1), ("a", 1)])
for kee, val in rdd.countByKey().items():
  print(kee, val)
('a, 2)
('b', 1)
PySpark के साथ Big Data Fundamentals

collectAsMap() action

  • collectAsMap() RDD के key-value पेयर्स को dictionary के रूप में रिटर्न करता है

  • एक सरल tuple पर collectAsMap() का उदाहरण

sc.parallelize([(1, 2), (3, 4)]).collectAsMap()
{1: 2, 3: 4}
PySpark के साथ Big Data Fundamentals

अभ्यास करते हैं!

PySpark के साथ Big Data Fundamentals

Preparing Video For Download...