Обзор PySpark MLlib

Основы Big Data с PySpark

Upendra Devisetty

Science Analyst, CyVerse

Что такое PySpark MLlib?

Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
  • MLlib — компонент Apache Spark для машинного обучения

  • Основные инструменты MLlib:

    • Алгоритмы МО: коллаборативная фильтрация, классификация и кластеризация

    • Векторизация: извлечение признаков, преобразование, снижение размерности и отбор

    • Пайплайны: инструменты построения, оценки и настройки пайплайнов МО

1 https://en.wikipedia.org/wiki/Machine_learning
Основы Big Data с PySpark

Почему PySpark MLlib?

  • Scikit-learn — популярная библиотека Python для интеллектуального анализа данных и машинного обучения

  • Алгоритмы Scikit-learn работают только с небольшими наборами данных на одной машине

  • Алгоритмы MLlib в Spark рассчитаны на параллельную обработку в кластере

  • Поддерживает языки Scala, Java и R

  • Предоставляет высокоуровневый API для построения пайплайнов машинного обучения

Основы Big Data с PySpark

Алгоритмы PySpark MLlib

  • Классификация (бинарная и многоклассовая) и регрессия: линейный SVM, логистическая регрессия, деревья решений, случайные леса, градиентный бустинг, наивный байесовский классификатор, МНК, Lasso, гребневая регрессия, изотонная регрессия

  • Коллаборативная фильтрация: метод чередующихся наименьших квадратов (ALS)

  • Кластеризация: K-means, смесь гауссиан, Bisecting K-means и Streaming K-Means

Основы Big Data с PySpark

Три направления машинного обучения в PySpark MLlib

  • Коллаборативная фильтрация (рекомендательные системы): формирует рекомендации

  • Классификация: определяет, к какой категории относится новое наблюдение

  • Кластеризация: группирует данные по схожим характеристикам

Основы Big Data с PySpark

Импорты PySpark MLlib

  • Коллаборативная фильтрация
from pyspark.mllib.recommendation import ALS
  • Классификация
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
  • Кластеризация
from pyspark.mllib.clustering import KMeans
Основы Big Data с PySpark

Давайте потренируемся!

Основы Big Data с PySpark

Preparing Video For Download...