Översikt av PySpark MLlib

Grunderna i Big Data med PySpark

Upendra Devisetty

Science Analyst, CyVerse

Vad är PySpark MLlib?

Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
  • MLlib är en komponent i Apache Spark för maskininlärning

  • Verktyg som MLlib tillhandahåller:

    • ML-algoritmer: kollaborativ filtrering, klassificering och klustring

    • Särdragsbearbetning: extraktion, transformation, dimensionsreducering och urval

    • Pipelines: verktyg för att bygga, utvärdera och finjustera ML-pipelines

1 https://en.wikipedia.org/wiki/Machine_learning
Grunderna i Big Data med PySpark

Varför PySpark MLlib?

  • Scikit-learn är ett populärt Python-bibliotek för datautvinning och maskininlärning

  • Scikit-learns algoritmer fungerar bara för små datamängder på en enskild maskin

  • Sparks MLlib-algoritmer är byggda för parallell bearbetning i ett kluster

  • Stöder språk som Scala, Java och R

  • Tillhandahåller ett högnivå-API för att bygga maskininlärningspipelines

Grunderna i Big Data med PySpark

PySpark MLlib-algoritmer

  • Klassificering (binär och multiklass) och regression: Linjära SVM:er, logistisk regression, beslutsträd, random forests, gradientboostade träd, naiv Bayes, linjära minsta kvadrater, Lasso, ridge-regression, isotonisk regression

  • Kollaborativ filtrering: Alternerande minsta kvadrater (ALS)

  • Klustring: K-means, Gaussisk blandning, Bisecting K-means och Streaming K-Means

Grunderna i Big Data med PySpark

Maskininlärningens tre K:n i PySpark MLlib

  • Kollaborativ filtrering (rekommendationsmotorer): genererar rekommendationer

  • Klassificering: avgör vilken kategori en ny observation tillhör

  • Klustring: grupperar data utifrån liknande egenskaper

Grunderna i Big Data med PySpark

Importer i PySpark MLlib

  • Kollaborativ filtrering
from pyspark.mllib.recommendation import ALS
  • Klassificering
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
  • Klustring
from pyspark.mllib.clustering import KMeans
Grunderna i Big Data med PySpark

Nu kör vi en övning!

Grunderna i Big Data med PySpark

Preparing Video For Download...