Nền tảng Big Data với PySpark
Upendra Devisetty
Science Analyst, CyVerse
Khối lượng, Đa dạng và Tốc độ
Khối lượng: Kích thước dữ liệu
Đa dạng: Nguồn và định dạng khác nhau
Tốc độ: Tốc độ dữ liệu
Điện toán cụm: Tập hợp tài nguyên của nhiều máy
Điện toán song song: Tính toán đồng thời trên một máy
Điện toán phân tán: Tập hợp các nút (máy tính mạng) chạy song song
Xử lý theo lô: Chia nhỏ công việc và chạy trên từng máy
Xử lý thời gian thực: Xử lý dữ liệu tức thì
Hadoop/MapReduce: Khung mở rộng, chịu lỗi viết bằng Java
Mã nguồn mở
Xử lý theo lô
Apache Spark: Hệ thống tính toán cụm đa năng, cực nhanh
Mã nguồn mở
Hỗ trợ xử lý theo lô và thời gian thực
Lưu ý: Ngày nay Apache Spark thường được ưu tiên hơn Hadoop/MapReduce
Khung tính toán cụm phân tán
Tính toán trong bộ nhớ hiệu quả cho tập dữ liệu lớn
Khung xử lý dữ liệu cực nhanh
Hỗ trợ Java, Scala, Python, R và SQL

Chế độ cục bộ: Một máy đơn như laptop của bạn
Chế độ cụm: Tập hợp máy được cấu hình sẵn
Quy trình: Cục bộ -> cụm
Không cần đổi mã
Nền tảng Big Data với PySpark