Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
บทที่ 1: พื้นฐานของ BigData และการแนะนำ Spark ในฐานะ distributed computing framework
องค์ประกอบหลัก: Spark Core และไลบรารีในตัว ได้แก่ Spark SQL, Spark MLlib, Graphx และ Spark Streaming
PySpark: Python API ของ Apache Spark สำหรับรัน Spark jobs
PySpark shell: สำหรับพัฒนาแอปพลิเคชันแบบโต้ตอบด้วย Python
โหมดของ Spark: Local และ cluster mode
บทที่ 2: แนะนำ RDDs คุณสมบัติของ RDDs วิธีสร้าง RDDs และการดำเนินการบน RDD (Transformations และ Actions)
บทที่ 3: แนะนำ Spark SQL การสรุปแบบ DataFrame การสร้าง DataFrames การดำเนินการบน DataFrame และการแสดงผล Big Data ผ่าน DataFrames
บทที่ 4: แนะนำ Spark MLlib และ 3C ของ Machine Learning (Collaborative filtering, Classification และ Clustering)
Big Data Fundamentals with PySpark