축하합니다!

PySpark로 배우는 빅데이터 기초

Upendra Devisetty

Science Analyst, CyVerse

빅데이터와 Apache Spark 기초

  • 1장: 빅데이터 기초와 분산 컴퓨팅 프레임워크로서의 Spark 소개

    • 핵심 구성요소: Spark Core와 내장 라이브러리 — Spark SQL, Spark MLlib, GraphX, Spark Streaming

    • PySpark: Spark 작업을 실행하는 Apache Spark의 Python API

    • PySpark 셸: Python으로 대화형 애플리케이션 개발

    • Spark 모드: 로컬 모드와 클러스터 모드

PySpark로 배우는 빅데이터 기초

Spark 구성요소

  • 2장: RDD 소개, RDD의 특징, RDD 생성 방법, RDD 연산(Transformations, Actions)

  • 3장: Spark SQL 소개, DataFrame 추상화, DataFrame 생성, 연산, DataFrame으로 빅데이터 시각화

  • 4장: Spark MLlib 소개, 머신러닝의 3C(협업 필터링, 분류, 클러스터링)

PySpark로 배우는 빅데이터 기초

다음 단계

PySpark로 배우는 빅데이터 기초

Preparing Video For Download...