Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse
Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
MLlib to komponent Apache Spark do uczenia maszynowego
Narzędzia dostępne w MLlib:
Algorytmy ML: filtrowanie kolaboratywne, klasyfikacja i grupowanie
Featuryzacja: ekstrakcja cech, transformacja, redukcja wymiarowości i selekcja
Potoki: narzędzia do budowania, oceny i dostrajania potoków ML
Scikit-learn to popularna biblioteka Pythona do eksploracji i uczenia maszynowego
Algorytmy Scikit-learn działają tylko na małych zbiorach danych na jednym komputerze
Algorytmy MLlib Spark są zaprojektowane do przetwarzania równoległego w klastrze
Obsługuje języki takie jak Scala, Java i R
Udostępnia wysokopoziomowe API do budowania potoków uczenia maszynowego
Klasyfikacja (binarna i wieloklasowa) i regresja: liniowe SVM, regresja logistyczna, drzewa decyzyjne, lasy losowe, drzewa wzmacniane gradientem, naiwny Bayes, liniowe najmniejsze kwadraty, Lasso, regresja grzbietowa, regresja izotoniczna
Filtrowanie kolaboratywne: Alternating Least Squares (ALS)
Grupowanie: K-means, mieszanina Gaussianów, Bisecting K-means i Streaming K-Means
Filtrowanie kolaboratywne (silniki rekomendacji): generowanie rekomendacji
Klasyfikacja: przypisywanie nowej obserwacji do jednej z kategorii
Grupowanie: grupowanie danych według podobnych cech
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
Podstawy Big Data z PySpark