Big Data Fundamentals with PySpark
Upendra Devisetty
Science Analyst, CyVerse
Volume, Variety และ Velocity
Volume: ขนาดของข้อมูล
Variety: แหล่งที่มาและรูปแบบที่หลากหลาย
Velocity: ความเร็วของข้อมูล
Clustered computing: การรวมทรัพยากรจากหลายเครื่องเข้าด้วยกัน
Parallel computing: การประมวลผลพร้อมกันบนเครื่องเดียว
Distributed computing: การรวมโหนด (คอมพิวเตอร์ที่เชื่อมต่อกัน) ให้ทำงานแบบขนาน
Batch processing: แบ่งงานเป็นชิ้นเล็กและรันบนแต่ละเครื่อง
Real-time processing: การประมวลผลข้อมูลทันที
Hadoop/MapReduce: เฟรมเวิร์กที่ขยายขนาดได้และทนต่อความล้มเหลว เขียนด้วย Java
โอเพนซอร์ส
Batch processing
Apache Spark: ระบบ cluster computing อเนกประสงค์ที่ประมวลผลได้รวดเร็ว
โอเพนซอร์ส
รองรับทั้ง batch และ real-time data processing
หมายเหตุ: ปัจจุบัน Apache Spark ได้รับความนิยมมากกว่า Hadoop/MapReduce
เฟรมเวิร์ก distributed cluster computing
ประมวลผลข้อมูลขนาดใหญ่บน in-memory ได้อย่างมีประสิทธิภาพ
เฟรมเวิร์กประมวลผลข้อมูลที่รวดเร็วมาก
รองรับ Java, Scala, Python, R และ SQL

Local mode: เครื่องเดียว เช่น แล็ปท็อป
Cluster mode: กลุ่มเครื่องที่กำหนดไว้ล่วงหน้า
เวิร์กโฟลว์: Local -> clusters
ไม่จำเป็นต้องแก้ไขโค้ด
Big Data Fundamentals with PySpark