พื้นฐาน Big Data

Big Data Fundamentals with PySpark

Upendra Devisetty

Science Analyst, CyVerse

Big Data คืออะไร?

  • Big data คือคำที่ใช้เรียกการศึกษาและการประยุกต์ใช้ชุดข้อมูลที่ซับซ้อนเกินกว่าซอฟต์แวร์ประมวลผลข้อมูลแบบดั้งเดิมจะรองรับได้ - Wikipedia
Big Data Fundamentals with PySpark

3 V's ของ Big Data

  • Volume, Variety และ Velocity

  • Volume: ขนาดของข้อมูล

  • Variety: แหล่งที่มาและรูปแบบที่หลากหลาย

  • Velocity: ความเร็วของข้อมูล

Big Data Fundamentals with PySpark

แนวคิดและคำศัพท์ Big Data

  • Clustered computing: การรวมทรัพยากรจากหลายเครื่องเข้าด้วยกัน

  • Parallel computing: การประมวลผลพร้อมกันบนเครื่องเดียว

  • Distributed computing: การรวมโหนด (คอมพิวเตอร์ที่เชื่อมต่อกัน) ให้ทำงานแบบขนาน

  • Batch processing: แบ่งงานเป็นชิ้นเล็กและรันบนแต่ละเครื่อง

  • Real-time processing: การประมวลผลข้อมูลทันที

Big Data Fundamentals with PySpark

ระบบประมวลผล Big Data

  • Hadoop/MapReduce: เฟรมเวิร์กที่ขยายขนาดได้และทนต่อความล้มเหลว เขียนด้วย Java

    • โอเพนซอร์ส

    • Batch processing

  • Apache Spark: ระบบ cluster computing อเนกประสงค์ที่ประมวลผลได้รวดเร็ว

    • โอเพนซอร์ส

    • รองรับทั้ง batch และ real-time data processing

  • หมายเหตุ: ปัจจุบัน Apache Spark ได้รับความนิยมมากกว่า Hadoop/MapReduce

Big Data Fundamentals with PySpark

คุณสมบัติของเฟรมเวิร์ก Apache Spark

  • เฟรมเวิร์ก distributed cluster computing

  • ประมวลผลข้อมูลขนาดใหญ่บน in-memory ได้อย่างมีประสิทธิภาพ

  • เฟรมเวิร์กประมวลผลข้อมูลที่รวดเร็วมาก

  • รองรับ Java, Scala, Python, R และ SQL

Big Data Fundamentals with PySpark

คอมโพเนนต์ของ Apache Spark

spark

Big Data Fundamentals with PySpark

โหมดการ deploy ของ Spark

  • Local mode: เครื่องเดียว เช่น แล็ปท็อป

    • เหมาะสำหรับการทดสอบ ดีบัก และสาธิต
  • Cluster mode: กลุ่มเครื่องที่กำหนดไว้ล่วงหน้า

    • เหมาะสำหรับ production
  • เวิร์กโฟลว์: Local -> clusters

  • ไม่จำเป็นต้องแก้ไขโค้ด

Big Data Fundamentals with PySpark

ถัดไป — PySpark

Big Data Fundamentals with PySpark

Preparing Video For Download...