使用 PySpark 的 Big Data 基礎
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark 以 Scala 撰寫
為了支援在 Spark 使用 Python,社群推出 PySpark
與 Scala 有相近的運算速度與效能
PySpark API 與 Pandas、Scikit-learn 類似
互動式環境,用來執行 Spark 作業
適合快速互動式雛形開發
Spark shell 可與磁碟或記憶體中的資料互動
三種 Spark shell:
Spark-shell(Scala)
PySpark-shell(Python)
SparkR(R)
PySpark shell 是以 Python 為基礎的命令列工具
它讓你能操作 Spark 的資料結構
PySpark shell 支援連線到叢集
SparkContext 是進入 Spark 世界的入口
入口點就是連線到 Spark 叢集的方式
可把入口點想成進門的鑰匙
PySpark 預設提供名為 sc 的 SparkContext
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() 方法rdd = sc.parallelize([1,2,3,4,5])
textFile() 方法rdd2 = sc.textFile("test.txt")
使用 PySpark 的 Big Data 基礎