Одновимірні гаусові суміші з flexmix

Мішанинні моделі в R

Victor Medina

Researcher at The University of Edinburgh

gender %>% 
  ggplot(aes(x = Weight)) + geom_histogram(bins = 100)

Мішанинні моделі в R

Моделювання сумішами розподілів

  1. Який розподіл імовірностей доречний?
    • Одновимірні гаусові розподіли
  2. Скільки підвибірок врахувати?
    • 2 кластери
  3. Які параметри та їхні оцінки?
    • Алгоритм EM у flexmix оцінює середні, стандартні відхилення та пропорції
Мішанинні моделі в R

Функція flexmix

flexmix(formula, data, k, model, control, ...)

  • formula: опис моделі для підгонки ($variable \sim 1$)
  • data: датафрейм
  • k: кількість кластерів
  • model: задає розподіл (FLXMCnorm1, FLXMCmvnorm, FLXMCmvbinary, FLXMRglm, FLXMCmvpois)
  • control: максимальна кількість ітерацій, толерантність тощо
Мішанинні моделі в R
fit_mixture <- flexmix(Weight ~ 1, # середні та SD сталі
                data = gender, # датафрейм
                k = 2, # кількість кластерів,
                model = FLXMCnorm1(), # одновимірний Gaussian    
                control = list(tol = 1e-15, # критерій зупинки EM
                               verbose = 1, # показувати проміжні результати
                               iter = 1e4)) # макс. кількість ітерацій
Classification: weighted 
   1 Log-likelihood :  -48880.0782 
   2 Log-likelihood :  -48880.0745 
   3 Log-likelihood :  -48880.0732 
   4 Log-likelihood :  -48880.0727
   .    .   .   .   .   .   .   .
3454 Log-likelihood :  -48518.3717 
3455 Log-likelihood :  -48518.3717 
3456 Log-likelihood :  -48518.3717 
3457 Log-likelihood :  -48518.3717 
converged
Мішанинні моделі в R

Пропорції: функція prior

proportions <- prior(fit_mixture)
proportions
0.4929668 0.5070332
Мішанинні моделі в R

Обидва розподіли

parameters(fit_mixture)
                    Comp.1    Comp.2
coef.(Intercept) 135.54652 186.61583
sigma             18.94726  19.96097

Кожен окремо

comp_1 <- parameters(fit_mixture, component = 1)
comp_2 <- parameters(fit_mixture, component = 2)
comp_2
                    Comp.2
coef.(Intercept) 186.61583
sigma             19.96097
Мішанинні моделі в R

Візуалізація отриманих розподілів

gender %>%
   ggplot() + geom_histogram(aes(x = Weight, y = ..density..)) + 
   stat_function(geom = "line", fun = fun_prop, 
                 args = list(mean = comp_1[1], 
                             sd = comp_1[2], 
                             proportion = proportions[1])) +
   stat_function(geom = "line", fun = fun_prop, 
                 args = list(mean = comp_2[1], 
                             sd = comp_2[2], 
                             proportion = proportions[2]))
Мішанинні моделі в R

Мішанинні моделі в R

Функція posterior

posterior(fit_mixture) %>% head()
             [,1]      [,2]
[1,] 6.836341e-06 0.9999932
[2,] 4.421760e-01 0.5578240
[3,] 5.994160e-04 0.9994006
[4,] 1.998798e-04 0.9998001
[5,] 1.547774e-03 0.9984522
[6,] 7.544450e-01 0.2455550

Функція clusters

clusters(fit_mixture) %>% head()
2 2 2 2 2 1
Мішанинні моделі в R

Порівняння призначень

table(gender$Gender, clusters(fit_mixture))
            1    2
  Female 4500  500
  Male    444 4556
Мішанинні моделі в R

Давайте потренуємось!

Мішанинні моделі в R

Preparing Video For Download...