빅데이터 기초

PySpark로 배우는 빅데이터 기초

Upendra Devisetty

Science Analyst, CyVerse

빅데이터란?

  • 빅데이터는 전통적 데이터 처리 소프트웨어로는 너무 복잡한 데이터 세트를 연구·활용하는 분야를 말함 - 위키백과
PySpark로 배우는 빅데이터 기초

빅데이터의 3V

  • 볼륨, 다양성, 속도

  • 볼륨: 데이터 크기

  • 다양성: 소스와 형식의 다양함

  • 속도: 데이터 유입·처리 속도

PySpark로 배우는 빅데이터 기초

빅데이터 개념과 용어

  • 클러스터 컴퓨팅: 여러 머신 자원 묶음

  • 병렬 컴퓨팅: 단일 컴퓨터에서 동시 계산

  • 분산 컴퓨팅: 네트워크 노드들이 병렬로 실행

  • 배치 처리: 작업을 조각내 각 머신에서 실행

  • 실시간 처리: 즉시 데이터 처리

PySpark로 배우는 빅데이터 기초

빅데이터 처리 시스템

  • Hadoop/MapReduce: 확장성·내결함성 있는 Java 기반 프레임워크

    • 오픈 소스

    • 배치 처리

  • Apache Spark: 범용·고속 클러스터 컴퓨팅 시스템

    • 오픈 소스

    • 배치와 실시간 처리 모두 지원

  • 참고: 현재는 Apache Spark가 Hadoop/MapReduce보다 선호됨

PySpark로 배우는 빅데이터 기초

Apache Spark의 특징

  • 분산 클러스터 컴퓨팅 프레임워크

  • 대규모 데이터의 효율적 인메모리 계산

  • 매우 빠른 데이터 처리 프레임워크

  • Java, Scala, Python, R, SQL 지원

PySpark로 배우는 빅데이터 기초

Apache Spark 구성 요소

스파크 구성 요소

PySpark로 배우는 빅데이터 기초

Spark 배포 모드

  • 로컬 모드: 노트북 등 단일 머신

    • 테스트, 디버깅, 데모에 편리
  • 클러스터 모드: 사전 구성된 여러 머신

    • 운영 환경에 적합
  • 워크플로: 로컬 -> 클러스터

  • 코드 변경 불필요

PySpark로 배우는 빅데이터 기초

다음: PySpark

PySpark로 배우는 빅데이터 기초

Preparing Video For Download...