使用 PySpark 的大数据基础
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark 使用 Scala 编写
为在 Spark 中支持 Python,社区发布了 PySpark
计算速度与能力与 Scala 接近
PySpark API 与 Pandas、Scikit-learn 相似
运行 Spark 作业的交互式环境
便于快速交互式原型开发
Spark shell 可与磁盘或内存中的数据交互
三种 Spark shell:
Spark-shell(Scala)
PySpark-shell(Python)
SparkR(R)
PySpark shell 是基于 Python 的命令行工具
PySpark shell 使数据科学家可操作 Spark 数据结构
PySpark shell 支持连接到集群
SparkContext 是进入 Spark 的入口
入口用于连接 Spark 集群
入口就像房子的钥匙
PySpark 有默认的 SparkContext:sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() 方法rdd = sc.parallelize([1,2,3,4,5])
textFile() 方法rdd2 = sc.textFile("test.txt")
使用 PySpark 的大数据基础