Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: ทนต่อความล้มเหลวได้
Distributed: กระจายทำงานบนหลายเครื่อง
Datasets: ชุดข้อมูลที่แบ่งพาร์ติชัน เช่น Arrays, Tables, Tuples เป็นต้น
Parallelize คอลเล็กชันที่มีอยู่
ชุดข้อมูลภายนอก:
ไฟล์ใน HDFS
ออบเจกต์ใน Amazon S3 bucket
บรรทัดในไฟล์ข้อความ
จาก RDD ที่มีอยู่แล้ว
parallelize() สร้าง RDD จาก Python listnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() สร้าง RDD จากชุดข้อมูลภายนอกfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
พาร์ติชันคือการแบ่งชุดข้อมูลแบบกระจายขนาดใหญ่ออกเป็นส่วนย่อยทางตรรกะ
เมธอด parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Big Data Fundamentals with PySpark