Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: Klarar av fel och avbrott
Distributed: Spänner över flera maskiner
Datasets: Samling partitionerad data, t.ex. arrayer, tabeller, tupler
Parallellisera en befintlig samling objekt
Externa datamängder:
Filer i HDFS
Objekt i Amazon S3-bucket
Rader i en textfil
Från befintliga RDD:er
parallelize() för att skapa RDD:er från Python-listornumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() för att skapa RDD:er från externa datamängderfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
En partition är en logisk uppdelning av en stor distribuerad datamängd
Metoden parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Grunderna i Big Data med PySpark