PySpark: Python으로 Spark 사용

PySpark로 배우는 빅데이터 기초

Upendra Devisetty

Science Analyst, CyVerse

PySpark 개요

  • Apache Spark는 Scala로 작성됨

  • Spark에서 Python을 지원하기 위해 커뮤니티가 PySpark를 공개함

  • Scala와 유사한 계산 속도와 성능

  • PySpark API는 Pandas, Scikit-learn과 유사함

PySpark로 배우는 빅데이터 기초

Spark 셸이란?

  • Spark 작업을 대화식으로 실행하는 환경

  • 빠른 프로토타이핑에 유용

  • 디스크/메모리의 데이터와 상호작용 가능

  • 세 가지 Spark 셸:

    • Scala용 Spark-shell

    • Python용 PySpark-shell

    • R용 SparkR

PySpark로 배우는 빅데이터 기초

PySpark 셸

  • PySpark 셸은 Python 기반 커맨드라인 도구

  • 데이터 과학자가 Spark 데이터 구조와 상호작용 가능

  • 클러스터 연결 지원

PySpark로 배우는 빅데이터 기초

SparkContext 이해하기

  • SparkContext는 Spark로 들어가는 진입점

  • 진입점은 Spark 클러스터에 연결하는 방법

  • 진입점은 집의 열쇠와 같음

  • PySpark에는 기본 SparkContext sc가 있음

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark로 배우는 빅데이터 기초

SparkContext 살펴보기

  • Version: SparkContext 버전 확인
sc.version
2.3.1
  • Python Version: SparkContext의 Python 버전 확인
sc.pythonVer
3.6
  • Master: 클러스터 URL 또는 로컬 모드용 문자열(SparkContext)
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark로 배우는 빅데이터 기초

PySpark에서 데이터 로딩

  • SparkContext의 parallelize() 메서드
rdd = sc.parallelize([1,2,3,4,5])
  • SparkContext의 textFile() 메서드
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark로 배우는 빅데이터 기초

연습해 봅시다

PySpark로 배우는 빅데이터 기초

Preparing Video For Download...