PySpark के साथ Big Data Fundamentals
Upendra Devisetty
Science Analyst, CyVerse


मूल RDD Transformations
map(), filter(), flatMap(), और union()map() transformation RDD के हर एलिमेंट पर एक function लगाता है
RDD = sc.parallelize([1,2,3,4])
RDD_map = RDD.map(lambda x: x * x)
filter() transformation केवल वे एलिमेंट रखकर नया RDD देता है जो शर्त पास करें
RDD = sc.parallelize([1,2,3,4])
RDD_filter = RDD.filter(lambda x: x > 2)
flatMap() transformation मूल RDD के हर एलिमेंट से कई मान लौटाता है
RDD = sc.parallelize(["hello world", "how are you"])
RDD_flatmap = RDD.flatMap(lambda x: x.split(" "))

inputRDD = sc.textFile("logs.txt")
errorRDD = inputRDD.filter(lambda x: "error" in x.split())
warningsRDD = inputRDD.filter(lambda x: "warnings" in x.split())
combinedRDD = errorRDD.union(warningsRDD)
ये वे ऑपरेशंस हैं जो RDD पर computation चलाकर कोई मान लौटाते हैं
मूल RDD Actions
collect()
take(N)
first()
count()
collect() पूरे डेटासेट के सभी एलिमेंट्स को array के रूप में लौटाता है
take(N) डेटासेट के पहले N एलिमेंट्स का array लौटाता है
RDD_map.collect()
[1, 4, 9, 16]
RDD_map.take(2)
[1, 4]
RDD_map.first()
[1]
RDD_flatmap.count()
5
PySpark के साथ Big Data Fundamentals