Основи Big Data з PySpark
Upendra Devisetty
Science Analyst, CyVerse
Machine learning is a scientific discipline that explores the construction and
study of algorithms that can learn from data
MLlib — це компонент Apache Spark для машинного навчання
MLlib надає різноманітні інструменти:
Алгоритми ML: колаборативна фільтрація, класифікація та кластеризація
Ознаковування: видобування ознак, перетворення, зменшення розмірності та відбір
Конвеєри: інструменти для побудови, оцінювання та налаштування ML-конвеєрів
Scikit-learn — популярна бібліотека Python для добування даних і машинного навчання
Алгоритми scikit-learn працюють лише з малими наборами даних на одній машині
Алгоритми Spark MLlib спроєктовано для паралельної обробки в кластері
Підтримує мови, зокрема Scala, Java та R
Надає високорівневий API для побудови конвеєрів машинного навчання
Класифікація (бінарна й мультикласова) та регресія: лінійні SVM, логістична регресія, дерева рішень, випадкові ліси, бустингові дерева, наївний Байєс, метод найменших квадратів, Lasso, гребенева регресія, ізотонічна регресія
Колаборативна фільтрація: Alternating least squares (ALS)
Кластеризація: K-means, гаусівська суміш, бісекційний K-means і Streaming K-Means
Колаборативна фільтрація (рекомендаційні системи): створює рекомендації
Класифікація: визначає, до якої категорії належить нове спостереження
Кластеризація: групує дані за подібними характеристиками
from pyspark.mllib.recommendation import ALS
from pyspark.mllib.classification import LogisticRegressionWithLBFGS
from pyspark.mllib.clustering import KMeans
Основи Big Data з PySpark