Aperçu de PySpark MLlib

Principes de Big Data avec PySpark

Upendra Devisetty

Science Analyst, CyVerse

Qu'est-ce que PySpark MLlib ?

Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
  • MLlib est un composant d'Apache Spark pour le Machine Learning

  • Parmi les outils offerts par MLlib :

    • Algorithmes ML : filtrage collaboratif, classification et regroupement

    • Caractérisation : extraction, transformation, réduction et sélection de caractéristiques

    • Chaînes de traitement : outils pour créer, évaluer et régler des pipelines ML

1 https://en.wikipedia.org/wiki/Machine_learning
Principes de Big Data avec PySpark

Pourquoi PySpark MLlib ?

  • Scikit-learn est une bibliothèque Python prisée pour l'exploration de données et le Machine Learning

  • Les algorithmes de scikit-learn ne conviennent qu'à de petits ensembles sur une seule machine

  • Les algorithmes de MLlib de Spark sont conçus pour le traitement parallèle sur grappe

  • Prend en charge des langues comme Scala, Java et R

  • Offre une API de haut niveau pour bâtir des pipelines de Machine Learning

Principes de Big Data avec PySpark

Algorithmes de PySpark MLlib

  • Classification (binaire et multiclasse) et régression : SVM linéaires, régression logistique, arbres de décision, forêts aléatoires, arbres à renforcement de gradient, naïf Bayes, moindres carrés linéaires, Lasso, régression ridge, régression isotonique

  • Filtrage collaboratif : moindres carrés alternés (ALS)

  • Regroupement : k-moyennes, mélange gaussien, k-moyennes bisection et K-Means en continu

Principes de Big Data avec PySpark

Les trois « C » du Machine Learning dans PySpark MLlib

  • Filtrage collaboratif (moteurs de recommandation) : produire des recommandations

  • Classification : déterminer à quelle catégorie appartient une nouvelle observation

  • Regroupement : regrouper des données selon des caractéristiques similaires

Principes de Big Data avec PySpark

Importations PySpark MLlib

  • Filtrage collaboratif
from pyspark.mllib.recommendation import ALS
  • Classification
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
  • Regroupement
from pyspark.mllib.clustering import KMeans
Principes de Big Data avec PySpark

Passons à la pratique !

Principes de Big Data avec PySpark

Preparing Video For Download...