Grunderna i Big Data med PySpark
Upendra Devisetty
Science Analyst, CyVerse
Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
MLlib är en komponent i Apache Spark för maskininlärning
Verktyg som MLlib tillhandahåller:
ML-algoritmer: kollaborativ filtrering, klassificering och klustring
Särdragsbearbetning: extraktion, transformation, dimensionsreducering och urval
Pipelines: verktyg för att bygga, utvärdera och finjustera ML-pipelines
Scikit-learn är ett populärt Python-bibliotek för datautvinning och maskininlärning
Scikit-learns algoritmer fungerar bara för små datamängder på en enskild maskin
Sparks MLlib-algoritmer är byggda för parallell bearbetning i ett kluster
Stöder språk som Scala, Java och R
Tillhandahåller ett högnivå-API för att bygga maskininlärningspipelines
Klassificering (binär och multiklass) och regression: Linjära SVM:er, logistisk regression, beslutsträd, random forests, gradientboostade träd, naiv Bayes, linjära minsta kvadrater, Lasso, ridge-regression, isotonisk regression
Kollaborativ filtrering: Alternerande minsta kvadrater (ALS)
Klustring: K-means, Gaussisk blandning, Bisecting K-means och Streaming K-Means
Kollaborativ filtrering (rekommendationsmotorer): genererar rekommendationer
Klassificering: avgör vilken kategori en ny observation tillhör
Klustring: grupperar data utifrån liknande egenskaper
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
Grunderna i Big Data med PySpark