Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark je napsán ve Scale
Pro podporu Pythonu vydala komunita Apache Spark PySpark
Srovnatelná rychlost a výkon jako Scala
API PySparku jsou podobná Pandas a Scikit-learn
Interaktivní prostředí pro spouštění úloh Spark
Vhodné pro rychlé interaktivní prototypování
Spark shell umožňuje práci s daty na disku i v paměti
Tři různá prostředí Spark shell:
Spark-shell pro Scala
PySpark-shell pro Python
SparkR pro R
PySpark shell je nástroj příkazové řádky založený na Pythonu
PySpark shell umožňuje datovým vědcům pracovat se strukturami dat Spark
PySpark shell podporuje připojení ke clusteru
SparkContext je vstupní bod do světa Spark
Vstupní bod slouží k připojení ke clusteru Spark
Vstupní bod je jako klíč od domu
PySpark má výchozí SparkContext s názvem sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() třídy SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() třídy SparkContextrdd2 = sc.textFile("test.txt")
Big Data Fundamentals with PySpark