Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: Odolnost vůči selhání
Distributed: Rozložení napříč více stroji
Datasets: Kolekce rozdělených dat, např. pole, tabulky, n-tice apod.
Paralelizace existující kolekce objektů
Externí datové sady:
Soubory v HDFS
Objekty v bucketu Amazon S3
Řádky textového souboru
Z existujících RDD
parallelize() pro vytváření RDD z pythonových seznamůnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() pro vytváření RDD z externích datových sadfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Partition je logické rozdělení velké distribuované datové sady
Metoda parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Big Data Fundamentals with PySpark