Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark est écrit en Scala
Pour prendre en charge Python avec Spark, la communauté Apache Spark a publié PySpark
Vitesse et puissance de calcul comparables à Scala
Les API PySpark ressemblent à Pandas et Scikit-learn
Environnement interactif pour exécuter des tâches Spark
Utile pour un prototypage interactif rapide
Les coquilles Spark permettent d'interagir avec les données sur disque ou en mémoire
Trois coquilles Spark :
Spark-shell pour Scala
PySpark-shell pour Python
SparkR pour R
La coquille PySpark est l'outil en ligne de commande basé sur Python
Elle permet aux spécialistes des données d'interagir avec les structures de données de Spark
Elle permet aussi de se connecter à un grapppeur
SparkContext est la porte d'entrée dans l'univers Spark
Une porte d'entrée est une façon de se connecter à un grapppeur Spark
Une porte d'entrée, c'est comme la clé de la maison
PySpark a un SparkContext par défaut nommé sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() de SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() de SparkContextrdd2 = sc.textFile("test.txt")
Principes de Big Data avec PySpark