Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark เขียนด้วย Scala
เพื่อรองรับ Python ชุมชน Apache Spark จึงเปิดตัว PySpark
ความเร็วและพลังในการประมวลผลใกล้เคียงกับ Scala
API ของ PySpark คล้ายกับ Pandas และ Scikit-learn
สภาพแวดล้อมแบบโต้ตอบสำหรับรันงาน Spark
เหมาะสำหรับการสร้างต้นแบบอย่างรวดเร็ว
Spark shell ช่วยให้โต้ตอบกับข้อมูลบนดิสก์หรือในหน่วยความจำได้
Spark shell มี 3 ประเภท:
Spark-shell สำหรับ Scala
PySpark-shell สำหรับ Python
SparkR สำหรับ R
PySpark shell คือเครื่องมือบรรทัดคำสั่งที่ใช้ Python
PySpark shell ช่วยให้นักวิทยาศาสตร์ข้อมูลโต้ตอบกับโครงสร้างข้อมูลของ Spark ได้
PySpark shell รองรับการเชื่อมต่อกับคลัสเตอร์
SparkContext คือจุดเริ่มต้นในการเข้าสู่โลกของ Spark
จุดเริ่มต้นนี้คือช่องทางเชื่อมต่อกับคลัสเตอร์ Spark
เปรียบได้กับกุญแจที่ใช้เปิดบ้าน
PySpark มี SparkContext เริ่มต้นชื่อ sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() ของ SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() ของ SparkContextrdd2 = sc.textFile("test.txt")
Big Data Fundamentals with PySpark