Nền tảng Big Data với PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark được viết bằng Scala
Để hỗ trợ Python với Spark, cộng đồng Apache Spark phát hành PySpark
Tốc độ và sức mạnh tính toán tương tự Scala
API PySpark giống Pandas và Scikit-learn
Môi trường tương tác để chạy job Spark
Hữu ích cho tạo mẫu nhanh tương tác
Spark shell cho phép tương tác với dữ liệu trên đĩa hoặc trong bộ nhớ
Ba loại shell Spark:
Spark-shell cho Scala
PySpark-shell cho Python
SparkR cho R
PySpark shell là công cụ dòng lệnh dựa trên Python
PySpark shell cho phép nhà khoa học dữ liệu tương tác với cấu trúc dữ liệu Spark
PySpark shell hỗ trợ kết nối tới cụm
SparkContext là điểm vào thế giới Spark
Điểm vào là cách kết nối tới cụm Spark
Điểm vào giống như chìa khóa vào nhà
PySpark có SparkContext mặc định tên là sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() của SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() của SparkContextrdd2 = sc.textFile("test.txt")
Nền tảng Big Data với PySpark