PySpark로 배우는 빅데이터 기초
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark는 Scala로 작성됨
Spark에서 Python을 지원하기 위해 커뮤니티가 PySpark를 공개함
Scala와 유사한 계산 속도와 성능
PySpark API는 Pandas, Scikit-learn과 유사함
Spark 작업을 대화식으로 실행하는 환경
빠른 프로토타이핑에 유용
디스크/메모리의 데이터와 상호작용 가능
세 가지 Spark 셸:
Scala용 Spark-shell
Python용 PySpark-shell
R용 SparkR
PySpark 셸은 Python 기반 커맨드라인 도구
데이터 과학자가 Spark 데이터 구조와 상호작용 가능
클러스터 연결 지원
SparkContext는 Spark로 들어가는 진입점
진입점은 Spark 클러스터에 연결하는 방법
진입점은 집의 열쇠와 같음
PySpark에는 기본 SparkContext sc가 있음
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() 메서드rdd = sc.parallelize([1,2,3,4,5])
textFile() 메서드rdd2 = sc.textFile("test.txt")
PySpark로 배우는 빅데이터 기초