Nền tảng Dữ liệu Lớn

Nền tảng Big Data với PySpark

Upendra Devisetty

Science Analyst, CyVerse

Dữ liệu Lớn là gì?

  • Dữ liệu Lớn là thuật ngữ chỉ việc nghiên cứu và ứng dụng các tập dữ liệu quá phức tạp với phần mềm xử lý dữ liệu truyền thống - Wikipedia
Nền tảng Big Data với PySpark

3 chữ V của Dữ liệu Lớn

  • Khối lượng, Đa dạng và Tốc độ

  • Khối lượng: Kích thước dữ liệu

  • Đa dạng: Nguồn và định dạng khác nhau

  • Tốc độ: Tốc độ dữ liệu

Nền tảng Big Data với PySpark

Khái niệm và thuật ngữ Dữ liệu Lớn

  • Điện toán cụm: Tập hợp tài nguyên của nhiều máy

  • Điện toán song song: Tính toán đồng thời trên một máy

  • Điện toán phân tán: Tập hợp các nút (máy tính mạng) chạy song song

  • Xử lý theo lô: Chia nhỏ công việc và chạy trên từng máy

  • Xử lý thời gian thực: Xử lý dữ liệu tức thì

Nền tảng Big Data với PySpark

Hệ thống xử lý Dữ liệu Lớn

  • Hadoop/MapReduce: Khung mở rộng, chịu lỗi viết bằng Java

    • Mã nguồn mở

    • Xử lý theo lô

  • Apache Spark: Hệ thống tính toán cụm đa năng, cực nhanh

    • Mã nguồn mở

    • Hỗ trợ xử lý theo lô và thời gian thực

  • Lưu ý: Ngày nay Apache Spark thường được ưu tiên hơn Hadoop/MapReduce

Nền tảng Big Data với PySpark

Tính năng của Apache Spark

  • Khung tính toán cụm phân tán

  • Tính toán trong bộ nhớ hiệu quả cho tập dữ liệu lớn

  • Khung xử lý dữ liệu cực nhanh

  • Hỗ trợ Java, Scala, Python, R và SQL

Nền tảng Big Data với PySpark

Các thành phần của Apache Spark

spark

Nền tảng Big Data với PySpark

Các chế độ triển khai Spark

  • Chế độ cục bộ: Một máy đơn như laptop của bạn

    • Thuận tiện để thử nghiệm, gỡ lỗi, trình diễn
  • Chế độ cụm: Tập hợp máy được cấu hình sẵn

    • Phù hợp cho sản xuất
  • Quy trình: Cục bộ -> cụm

  • Không cần đổi mã

Nền tảng Big Data với PySpark

Tiếp theo - PySpark

Nền tảng Big Data với PySpark

Preparing Video For Download...