PySpark RDD परिचय

PySpark के साथ Big Data Fundamentals

Upendra Devisetty

Science Analyst, CyVerse

RDD क्या है?

  • RDD = Resilient Distributed Datasets

rdd

PySpark के साथ Big Data Fundamentals

RDDs को भागों में समझना

  • Resilient Distributed Datasets

    • Resilient: फेल्योर सहने की क्षमता

    • Distributed: कई मशीनों पर फैला हुआ

    • Datasets: विभाजित डेटा का कलेक्शन, जैसे Arrays, Tables, Tuples आदि

PySpark के साथ Big Data Fundamentals

RDDs बनाना. कैसे करें?

  • मौजूदा ऑब्जेक्ट कलेक्शन को parallelize करना

  • External datasets:

    • HDFS में फाइलें

    • Amazon S3 बकेट में ऑब्जेक्ट्स

    • टेक्स्ट फाइल की lines

  • मौजूदा RDDs से

PySpark के साथ Big Data Fundamentals

Parallelized collection (parallelizing)

  • parallelize() से Python lists से RDDs बनाते हैं
numRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
PySpark के साथ Big Data Fundamentals

External datasets से

  • textFile() से external datasets से RDDs बनाते हैं
fileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
PySpark के साथ Big Data Fundamentals

PySpark में Partitioning समझना

  • Partition एक बड़े distributed dataset का लॉजिकल डिवीजन है

  • parallelize() मेथड

numRDD = sc.parallelize(range(10), minPartitions = 6)
  • textFile() मेथड
fileRDD = sc.textFile("README.md", minPartitions = 6)
  • RDD में partitions की संख्या getNumPartitions() मेथड से पता करें
PySpark के साथ Big Data Fundamentals

अभ्यास करते हैं!

PySpark के साथ Big Data Fundamentals

Preparing Video For Download...