Fundamentele Big Data cu PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: Capacitatea de a rezista la erori
Distributed: Distribuit pe mai multe mașini
Datasets: Colecție de date parționate, ex.: tablouri, tabele, tuple etc.
Paralelizarea unei colecții existente de obiecte
Seturi de date externe:
Fișiere în HDFS
Obiecte în bucket Amazon S3
Linii dintr-un fișier text
Din RDD-uri existente
parallelize() pentru crearea RDD-urilor din liste PythonnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() pentru crearea RDD-urilor din seturi de date externefileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
O partiție este o diviziune logică a unui set de date distribuit
Metoda parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Fundamentele Big Data cu PySpark