병렬 계산 프레임워크

데이터 엔지니어링 입문

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Apache Hadoop 로고

데이터 엔지니어링 입문

HDFS

 

분산 파일 시스템인 HDFS 다이어그램

데이터 엔지니어링 입문

MapReduce

 

Hadoop MapReduce 로고

 

올림픽 이벤트 예시를 보여주는 다이어그램

데이터 엔지니어링 입문

Hive

 

  • Hadoop 위에서 동작
  • 구조적 쿼리 언어: Hive SQL
  • 초기엔 MapReduce, 이제는 다른 도구도 지원

Apache Hive 로고

데이터 엔지니어링 입문

Hive: 예시

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive에서 MapReduce로의 다이어그램

데이터 엔지니어링 입문

Spark 로고 이미지

  • 디스크 쓰기 최소화
  • Apache Software Foundation 관리
데이터 엔지니어링 입문

RDD(탄력적 분산 데이터셋)

 

  • Spark의 핵심
  • 튜플 리스트와 유사
  • 변환: .map() 또는 .filter()
  • 액션: .count() 또는 .first()
데이터 엔지니어링 입문

PySpark

 

  • Spark의 Python 인터페이스
  • DataFrame 추상화
  • Pandas와 유사한 형태
데이터 엔지니어링 입문

PySpark: 예시

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
데이터 엔지니어링 입문

연습해 봅시다!

데이터 엔지니어링 입문

Preparing Video For Download...