Класифікація

Основи Big Data з PySpark

Upendra Devisetty

Science Analyst, CyVerse

Класифікація в PySpark MLlib

  • Класифікація — це алгоритм контрольованого машинного навчання для розподілу вхідних даних за категоріями

Основи Big Data з PySpark

Вступ до логістичної регресії

  • Логістична регресія передбачає бінарну відповідь на основі кількох змінних

Основи Big Data з PySpark

Робота з векторами

  • PySpark MLlib має спеціальні типи даних Vectors і LabelledPoint

  • Два типи векторів

    • Dense Vector: зберігає всі елементи в масиві чисел з плаваючою комою
    • Sparse Vector: зберігає лише ненульові значення та їхні індекси
denseVec = Vectors.dense([1.0, 2.0, 3.0])
DenseVector([1.0, 2.0, 3.0])
sparseVec = Vectors.sparse(4, {1: 1.0, 3: 5.5})
SparseVector(4, {1: 1.0, 3: 5.5})
Основи Big Data з PySpark

LabeledPoint() у PySpark MLlib

  • LabeledPoint — це обгортка для вхідних ознак і значення мітки

  • Для бінарної класифікації в логістичній регресії мітка — це 0 (негативний) або 1 (позитивний)

positive = LabeledPoint(1.0, [1.0, 0.0, 3.0])
negative = LabeledPoint(0.0, [2.0, 1.0, 1.0])
print(positive)
print(negative)
LabeledPoint(1.0, [1.0,0.0,3.0])
LabeledPoint(0.0, [2.0,1.0,1.0])
Основи Big Data з PySpark

HashingTF() у PySpark MLlib

  • Алгоритм HashingTF() відображає значення ознак на індекси у векторі ознак
from pyspark.mllib.feature import HashingTF
sentence = "hello hello world"
words = sentence.split()
tf = HashingTF(10000) 
tf.transform(words)
SparseVector(10000, {3065: 1.0, 6861: 2.0})
Основи Big Data з PySpark

Логістична регресія з LogisticRegressionWithLBFGS

  • Логістичну регресію в PySpark MLlib реалізує клас LogisticRegressionWithLBFGS
data = [
        LabeledPoint(0.0, [0.0, 1.0]),
        LabeledPoint(1.0, [1.0, 0.0]),
]
RDD = sc.parallelize(data)
lrm = LogisticRegressionWithLBFGS.train(RDD)
lrm.predict([1.0, 0.0])
lrm.predict([0.0, 1.0])
1
0
Основи Big Data з PySpark

Фінальний слайд

Основи Big Data з PySpark

Preparing Video For Download...