PySpark로 배우는 빅데이터 기초
Upendra Devisetty
Science Analyst, CyVerse

Resilient Distributed Datasets
Resilient: 장애를 견딜 수 있음
Distributed: 여러 머신에 분산됨
Datasets: 파티션된 데이터 모음(예: 배열, 테이블, 튜플 등)
기존 객체 컬렉션을 병렬화
외부 데이터셋:
HDFS의 파일
Amazon S3 버킷의 객체
텍스트 파일의 라인
기존 RDD에서 생성
parallelize() 사용numRDD = sc.parallelize([1,2,3,4])
helloRDD = sc.parallelize("Hello world")
type(helloRDD)
<class 'pyspark.rdd.PipelinedRDD'>
textFile() 사용fileRDD = sc.textFile("README.md")
type(fileRDD)
<class 'pyspark.rdd.PipelinedRDD'>
파티션은 대규모 분산 데이터셋의 논리적 분할입니다
parallelize() 메서드
numRDD = sc.parallelize(range(10), minPartitions = 6)
textFile() 메서드fileRDD = sc.textFile("README.md", minPartitions = 6)
getNumPartitions() 메서드로 확인합니다PySpark로 배우는 빅데이터 기초