Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark är skrivet i Scala
För att stödja Python lanserade Apache Spark Community PySpark
Likvärdig beräkningshastighet och kapacitet som Scala
PySparks API:er liknar Pandas och Scikit-learn
Interaktiv miljö för att köra Spark-jobb
Användbar för snabb interaktiv prototypning
Spark-skal möjliggör interaktion med data på disk eller i minnet
Tre olika Spark-skal:
Spark-shell för Scala
PySpark-shell för Python
SparkR för R
PySpark-skalet är ett Python-baserat kommandoradsverktyg
PySpark-skalet låter datavetare interagera med Sparks datastrukturer
PySpark-skalet stöder anslutning till ett kluster
SparkContext är ingångspunkten till Sparks värld
En ingångspunkt är sättet att ansluta till ett Spark-kluster
En ingångspunkt fungerar som en nyckel till huset
PySpark har en standardmässig SparkContext som heter sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize()-metodrdd = sc.parallelize([1,2,3,4,5])
textFile()-metodrdd2 = sc.textFile("test.txt")
Grunderna i Big Data med PySpark