Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient : tolérant aux pannes
Distributed : réparti sur plusieurs machines
Datasets : ensemble de données partitionné (tableaux, tables, tuples, etc.)
Paralléliser une collection d'objets existante
Jeux de données externes :
Fichiers dans HDFS
Objets dans un compartiment Amazon S3
Lignes d'un fichier texte
À partir de RDD existants
parallelize() pour créer des RDD à partir de listes PythonnumRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() pour créer des RDD à partir de jeux de données externesfileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
Une partition est une division logique d'un grand ensemble de données distribué
Méthode parallelize()
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile()fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions()Principes de Big Data avec PySpark