Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: здатність витримувати збої
Distributed: розподілені між кількома машинами
Datasets: колекція розбитих на частини даних, напр., масиви, таблиці, кортежі тощо
Паралелізація наявної колекції об'єктів
Зовнішні набори даних:
файли в HDFS
об'єкти в Amazon S3 bucket
рядки у текстовому файлі
З наявних RDD
parallelize() для створення RDD зі списків PythonnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() для створення RDD із зовнішніх наборів данихfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Розділ — це логічний поділ великого розподіленого набору даних
метод parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Основи Big Data з PySpark