Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: odporność na awarie
Distributed: rozłożenie na wiele maszyn
Datasets: kolekcja podzielonych danych, np. tablice, tabele, krotki
Zrównoleglenie istniejącej kolekcji obiektów
Zewnętrzne zbiory danych:
Pliki w HDFS
Obiekty w zasobniku Amazon S3
Wiersze w pliku tekstowym
Z istniejących RDD
parallelize() – tworzenie RDD z list PythonanumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() – tworzenie RDD z zewnętrznych zbiorów danychfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Partycja to logiczny podział dużego rozproszonego zbioru danych
Metoda parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Podstawy Big Data z PySpark