PySpark로 배우는 빅데이터 기초
Upendra Devisetty
Science Analyst, CyVerse
기계 학습은 데이터로부터 학습하는 알고리즘의 구성과 연구를 다루는 학문 분야입니다
MLlib이 제공하는 도구:
ML 알고리즘: 협업 필터링, 분류, 클러스터링
특징화: 특징 추출, 변환, 차원 축소, 선택
파이프라인: ML 파이프라인의 구성, 평가, 튜닝 도구
Scikit-learn은 데이터 마이닝과 기계 학습을 위한 인기 있는 Python 라이브러리입니다
Scikit-learn 알고리즘은 단일 머신의 소규모 데이터셋에만 적합합니다
Spark MLlib 알고리즘은 클러스터의 병렬 처리를 위해 설계되었습니다
Scala, Java, R 등의 언어를 지원합니다
기계 학습 파이프라인 구축을 위한 고수준 API를 제공합니다
분류(이진·다중)와 회귀: 선형 SVM, 로지스틱 회귀, 결정 트리, 랜덤 포레스트, 그래디언트 부스팅 트리, 나이브 베이즈, 최소제곱선형회귀, Lasso, Ridge 회귀, 아이소토닉 회귀
협업 필터링: 교대 최소제곱법(ALS)
클러스터링: K-평균, 가우시안 혼합, 이분 K-평균, 스트리밍 K-평균
협업 필터링(추천 엔진): 추천 생성
분류: 새 관측치가 속할 범주 식별
클러스터링: 유사 특성으로 데이터 그룹화
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
PySpark로 배우는 빅데이터 기초