PySpark के साथ Big Data Fundamentals
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: फेल्योर सहने की क्षमता
Distributed: कई मशीनों पर फैला हुआ
Datasets: विभाजित डेटा का कलेक्शन, जैसे Arrays, Tables, Tuples आदि
मौजूदा ऑब्जेक्ट कलेक्शन को parallelize करना
External datasets:
HDFS में फाइलें
Amazon S3 बकेट में ऑब्जेक्ट्स
टेक्स्ट फाइल की lines
मौजूदा RDDs से
parallelize() से Python lists से RDDs बनाते हैंnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() से external datasets से RDDs बनाते हैंfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Partition एक बड़े distributed dataset का लॉजिकल डिवीजन है
parallelize() मेथड
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile() मेथडfileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions() मेथड से पता करेंPySpark के साथ Big Data Fundamentals