Основы Big Data с PySpark
Upendra Devisetty
Science Analyst, CyVerse
Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
MLlib — компонент Apache Spark для машинного обучения
Основные инструменты MLlib:
Алгоритмы МО: коллаборативная фильтрация, классификация и кластеризация
Векторизация: извлечение признаков, преобразование, снижение размерности и отбор
Пайплайны: инструменты построения, оценки и настройки пайплайнов МО
Scikit-learn — популярная библиотека Python для интеллектуального анализа данных и машинного обучения
Алгоритмы Scikit-learn работают только с небольшими наборами данных на одной машине
Алгоритмы MLlib в Spark рассчитаны на параллельную обработку в кластере
Поддерживает языки Scala, Java и R
Предоставляет высокоуровневый API для построения пайплайнов машинного обучения
Классификация (бинарная и многоклассовая) и регрессия: линейный SVM, логистическая регрессия, деревья решений, случайные леса, градиентный бустинг, наивный байесовский классификатор, МНК, Lasso, гребневая регрессия, изотонная регрессия
Коллаборативная фильтрация: метод чередующихся наименьших квадратов (ALS)
Кластеризация: K-means, смесь гауссиан, Bisecting K-means и Streaming K-Means
Коллаборативная фильтрация (рекомендательные системы): формирует рекомендации
Классификация: определяет, к какой категории относится новое наблюдение
Кластеризация: группирует данные по схожим характеристикам
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
Основы Big Data с PySpark