Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: устойчивость к сбоям
Distributed: распределение по нескольким машинам
Datasets: коллекция разделённых данных, например массивы, таблицы, кортежи и др.
Параллелизация существующей коллекции объектов
Внешние наборы данных:
Файлы в HDFS
Объекты в Amazon S3
Строки текстового файла
Из существующих RDD
parallelize() — создание RDD из списков PythonnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() — создание RDD из внешних наборов данныхfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Раздел — это логическая единица большого распределённого набора данных
Метод parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Основы Big Data с PySpark