PySpark로 배우는 빅데이터 기초
Upendra Devisetty
Science Analyst, CyVerse
1장: 빅데이터 기초와 분산 컴퓨팅 프레임워크로서의 Spark 소개
핵심 구성요소: Spark Core와 내장 라이브러리 — Spark SQL, Spark MLlib, GraphX, Spark Streaming
PySpark: Spark 작업을 실행하는 Apache Spark의 Python API
PySpark 셸: Python으로 대화형 애플리케이션 개발
Spark 모드: 로컬 모드와 클러스터 모드
2장: RDD 소개, RDD의 특징, RDD 생성 방법, RDD 연산(Transformations, Actions)
3장: Spark SQL 소개, DataFrame 추상화, DataFrame 생성, 연산, DataFrame으로 빅데이터 시각화
4장: Spark MLlib 소개, 머신러닝의 3C(협업 필터링, 분류, 클러스터링)
PySpark로 배우는 빅데이터 기초