PySpark로 배우는 빅데이터 기초
Upendra Devisetty
Science Analyst, CyVerse
볼륨, 다양성, 속도
볼륨: 데이터 크기
다양성: 소스와 형식의 다양함
속도: 데이터 유입·처리 속도
클러스터 컴퓨팅: 여러 머신 자원 묶음
병렬 컴퓨팅: 단일 컴퓨터에서 동시 계산
분산 컴퓨팅: 네트워크 노드들이 병렬로 실행
배치 처리: 작업을 조각내 각 머신에서 실행
실시간 처리: 즉시 데이터 처리
Hadoop/MapReduce: 확장성·내결함성 있는 Java 기반 프레임워크
오픈 소스
배치 처리
Apache Spark: 범용·고속 클러스터 컴퓨팅 시스템
오픈 소스
배치와 실시간 처리 모두 지원
참고: 현재는 Apache Spark가 Hadoop/MapReduce보다 선호됨
분산 클러스터 컴퓨팅 프레임워크
대규모 데이터의 효율적 인메모리 계산
매우 빠른 데이터 처리 프레임워크
Java, Scala, Python, R, SQL 지원

로컬 모드: 노트북 등 단일 머신
클러스터 모드: 사전 구성된 여러 머신
워크플로: 로컬 -> 클러스터
코드 변경 불필요
PySpark로 배우는 빅데이터 기초