Principes de Big Data avec PySpark
Upendra Devisetty
Science Analyst, CyVerse
Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
MLlib est un composant d'Apache Spark pour le Machine Learning
Parmi les outils offerts par MLlib :
Algorithmes ML : filtrage collaboratif, classification et regroupement
Caractérisation : extraction, transformation, réduction et sélection de caractéristiques
Chaînes de traitement : outils pour créer, évaluer et régler des pipelines ML
Scikit-learn est une bibliothèque Python prisée pour l'exploration de données et le Machine Learning
Les algorithmes de scikit-learn ne conviennent qu'à de petits ensembles sur une seule machine
Les algorithmes de MLlib de Spark sont conçus pour le traitement parallèle sur grappe
Prend en charge des langues comme Scala, Java et R
Offre une API de haut niveau pour bâtir des pipelines de Machine Learning
Classification (binaire et multiclasse) et régression : SVM linéaires, régression logistique, arbres de décision, forêts aléatoires, arbres à renforcement de gradient, naïf Bayes, moindres carrés linéaires, Lasso, régression ridge, régression isotonique
Filtrage collaboratif : moindres carrés alternés (ALS)
Regroupement : k-moyennes, mélange gaussien, k-moyennes bisection et K-Means en continu
Filtrage collaboratif (moteurs de recommandation) : produire des recommandations
Classification : déterminer à quelle catégorie appartient une nouvelle observation
Regroupement : regrouper des données selon des caractéristiques similaires
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
Principes de Big Data avec PySpark