PySpark MLlib 개요

PySpark로 배우는 빅데이터 기초

Upendra Devisetty

Science Analyst, CyVerse

PySpark MLlib이란?

기계 학습은 데이터로부터 학습하는 알고리즘의 구성과 연구를 다루는 학문 분야입니다
  • MLlib은 Apache Spark의 기계 학습 구성 요소입니다
  • MLlib이 제공하는 도구:

    • ML 알고리즘: 협업 필터링, 분류, 클러스터링

    • 특징화: 특징 추출, 변환, 차원 축소, 선택

    • 파이프라인: ML 파이프라인의 구성, 평가, 튜닝 도구

1 https://en.wikipedia.org/wiki/Machine_learning
PySpark로 배우는 빅데이터 기초

왜 PySpark MLlib인가요?

  • Scikit-learn은 데이터 마이닝과 기계 학습을 위한 인기 있는 Python 라이브러리입니다

  • Scikit-learn 알고리즘은 단일 머신의 소규모 데이터셋에만 적합합니다

  • Spark MLlib 알고리즘은 클러스터의 병렬 처리를 위해 설계되었습니다

  • Scala, Java, R 등의 언어를 지원합니다

  • 기계 학습 파이프라인 구축을 위한 고수준 API를 제공합니다

PySpark로 배우는 빅데이터 기초

PySpark MLlib 알고리즘

  • 분류(이진·다중)와 회귀: 선형 SVM, 로지스틱 회귀, 결정 트리, 랜덤 포레스트, 그래디언트 부스팅 트리, 나이브 베이즈, 최소제곱선형회귀, Lasso, Ridge 회귀, 아이소토닉 회귀

  • 협업 필터링: 교대 최소제곱법(ALS)

  • 클러스터링: K-평균, 가우시안 혼합, 이분 K-평균, 스트리밍 K-평균

PySpark로 배우는 빅데이터 기초

PySpark MLlib의 ML 3C

  • 협업 필터링(추천 엔진): 추천 생성

  • 분류: 새 관측치가 속할 범주 식별

  • 클러스터링: 유사 특성으로 데이터 그룹화

PySpark로 배우는 빅데이터 기초

PySpark MLlib 임포트

  • 협업 필터링
from pyspark.mllib.recommendation import ALS
  • 분류
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
  • 클러스터링
from pyspark.mllib.clustering import KMeans
PySpark로 배우는 빅데이터 기초

연습해 봅시다

PySpark로 배우는 빅데이터 기초

Preparing Video For Download...