Fundamentele Big Data cu PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark este scris în Scala
Pentru a suporta Python, comunitatea Apache Spark a lansat PySpark
Viteză și putere de calcul similare cu Scala
API-urile PySpark sunt similare cu Pandas și Scikit-learn
Mediu interactiv pentru rularea joburilor Spark
Util pentru prototipare rapidă și interactivă
Shell-urile Spark permit interacțiunea cu date de pe disc sau din memorie
Trei tipuri de shell-uri Spark:
Spark-shell pentru Scala
PySpark-shell pentru Python
SparkR pentru R
Shell-ul PySpark este un instrument de linie de comandă bazat pe Python
Permite oamenilor de știință ai datelor să interacționeze cu structurile de date Spark
Suportă conectarea la un cluster
SparkContext este punctul de intrare în lumea Spark
Punctul de intrare reprezintă modalitatea de conectare la clusterul Spark
Punctul de intrare este ca o cheie a casei
PySpark are un SparkContext implicit numit sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() a SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() a SparkContextrdd2 = sc.textFile("test.txt")
Fundamentele Big Data cu PySpark