Nền tảng Big Data với PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: Khả năng chịu lỗi
Distributed: Chạy trên nhiều máy
Datasets: Tập dữ liệu được phân mảnh, ví dụ: mảng, bảng, bộ 3, v.v.
Song song hóa một tập hợp đối tượng có sẵn
Nguồn dữ liệu ngoài:
Tệp trong HDFS
Đối tượng trong Amazon S3 bucket
Các dòng trong tệp văn bản
Từ các RDD hiện có
parallelize() để tạo RDD từ danh sách PythonnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() để tạo RDD từ nguồn dữ liệu ngoàifileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Partition là phần chia logic của một tập dữ liệu phân tán lớn
Phương thức parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Nền tảng Big Data với PySpark