병렬 계산 프레임워크

데이터 엔지니어링 입문

Vincent Vankrunkelsven

Data Engineer, DataCamp

 

Apache Hadoop 로고

데이터 엔지니어링 입문

HDFS

 

분산 파일 시스템인 HDFS 다이어그램

데이터 엔지니어링 입문

MapReduce

 

Hadoop MapReduce 로고

 

올림픽 이벤트 예시를 보여주는 다이어그램

데이터 엔지니어링 입문

Hive

 

  • Hadoop 위에서 동작
  • 구조적 쿼리 언어: Hive SQL
  • 초기엔 MapReduce, 이제는 다른 도구도 지원

Apache Hive 로고

데이터 엔지니어링 입문

Hive: 예시

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive에서 MapReduce로의 다이어그램

데이터 엔지니어링 입문

Spark 로고 이미지

  • 디스크 쓰기 최소화
  • Apache Software Foundation 관리
데이터 엔지니어링 입문

RDD(탄력적 분산 데이터셋)

 

  • Spark의 핵심
  • 튜플 리스트와 유사
  • 변환: .map() 또는 .filter()
  • 액션: .count() 또는 .first()
데이터 엔지니어링 입문

PySpark

 

  • Spark의 Python 인터페이스
  • DataFrame 추상화
  • Pandas와 유사한 형태
데이터 엔지니어링 입문

PySpark: 예시

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
데이터 엔지니어링 입문

연습해 봅시다!

데이터 엔지니어링 입문

Preparing Video For Download...