Лінійні опорні вектори (SVM)

Support Vector Machines в R

Kailash Awati

Instructor

Розбиття на тренувальну і тестову вибірки

  • Набір даних, згенерований у попередньому розділі, у датафреймі df.
  • Розбийте набір даних на тренувальну і тестову вибірки
  • Випадковий поділ 80/20
    # Set seed for reproducibility
    set.seed(1)
    # Set the upper bound for the number of rows to be in the training set
    sample_size <- floor(0.8 * nrow(df))
    # Assign rows to training/test sets randomly in 80/20 proportion
    train <- sample(seq_len(nrow(df)), size = sample_size)
    # Separate training and test sets
    trainset <- df[train, ]
    testset <- df[-train, ]
    
Support Vector Machines в R

Межі рішення та ядра

  • Межі рішення можуть мати різну форму – прямі, поліноми чи складніші функції.
  • Тип межі рішення називається ядром.
  • Ядро слід вказати заздалегідь.
  • У цьому розділі зосередимось на лінійних ядрах.
Support Vector Machines в R

SVM з лінійним ядром

  • Використаємо функцію svm з бібліотеки e1071.
  • Функція має кілька параметрів. Ми явно задамо такі:
    • formula – формула, що визначає залежну змінну, у нас це y.
    • data – датафрейм із даними, тобто trainset.
    • type – встановіть C-classification (задача класифікації).
    • kernel – форма межі рішення, тут лінійна.
    • cost і gamma – параметри для налаштування моделі.
    • scale – булевий прапорець, чи масштабувати дані.
Support Vector Machines в R

Побудова лінійного SVM

  • Завантажте бібліотеку e1071 і викличте функцію svm()
library(e1071)
svm_model<- svm(y ~ .,
                data = trainset, 
                type = "C-classification", 
                kernel = "linear", 
                scale = FALSE)
Support Vector Machines в R

Огляд моделі

  • Виведення svm_model дає:
    • огляд моделі, зокрема тип класифікації та ядра
    • значення параметрів налаштування
svm_model
Call:
svm(formula = y ~ .,
    data = trainset,
    type = "C-classification",
    kernel = "linear", 
    scale = FALSE)

Parameters:
   SVM-Type:  C-classification 
 SVM-Kernel:  linear 
       cost:  1 
      gamma:  0.5

Number of Support Vectors: 55
Support Vector Machines в R
# Index of support vectors in training dataset
svm_model$index

# Support vectors svm_model$SV
# Negative intercept (unweighted) svm_model$rho
# Weighting coefficients for support vectors svm_model$coefs
4   8  10  11  18  37  38  39  47  59  60  74  76  77  78  80  83 ...

x1 x2 5 0.519095949 0.44232464
-0.1087075
[,1] [1,] 1.0000000
Support Vector Machines в R
  • Отримайте прогноз класів для тренувальної і тестової вибірок.
  • Оцініть точність моделі на тренуванні та тесті.
# Training accuracy
pred_train <- predict(svm_model, trainset)
mean(pred_train == trainset$y)
1
# Test accuracy
pred_test <- predict(svm_model, testset)
mean(pred_test == testset$y)
1
# Ідеально!!
Support Vector Machines в R

Час потренуватись!

Support Vector Machines в R

Preparing Video For Download...