Introduktion till modellbaserad klustring

Blandningsmodeller i R

Victor Medina

Researcher at The University of Edinburgh

Vad är klustring?

Att dela upp en uppsättning observationer i meningsfulla undergrupper

 $\to$ Hjälper till att utforska och förstå den naturliga strukturen i en datamängd

Blandningsmodeller i R

Tillämpningar av klustring

  • Medicin
    • Ex. Inom medicinsk bildanalys för att skilja mellan olika typer av vävnad
  • Näringsliv
    • Ex. För att identifiera distinkta kundgrupper och utveckla riktade marknadsföringsprogram
  • Samhällsvetenskap
    • Ex. För att identifiera zoner i en stad utifrån brottstyp och fördela polisresurser mer effektivt
Blandningsmodeller i R

Klustringsmetoder

  • Partitioneringsmetoder
    • Hittar klustercentrum bland observationerna och tilldelar varje observation det närmaste klustret. Ex. Kmeans
  • Hierarkiska metoder
    • Kopplar samman observationer utifrån likhet för att bilda kluster. Ex. Hierarkisk klustring
  • Modellbaserade metoder
    • Använder sannolikhetsfördelningar för att skapa kluster. Ex. Blandningsmodeller
Blandningsmodeller i R

Datamängden gender

gender <- read.csv("gender.csv")
head(gender)
    Height   Weight      BMI
1 73.84702 241.8936 31.18576
2 68.78190 162.3105 24.12104
3 74.11011 212.7409 27.23291
4 71.73098 220.0425 30.06706
5 69.88180 206.3498 29.70803
6 67.25302 152.2122 23.66049
Blandningsmodeller i R

Datamängden gender: Kan du gissa könet?

library(ggplot2)
ggplot(gender, aes(x = Weight, y = BMI)) + geom_points()

Blandningsmodeller i R

Datamängden gender: Kan du gissa könet?

Blandningsmodeller i R

Med traditionella klustringsmetoder

Blandningsmodeller i R

Modellbaserad klustring

Blandningsmodeller i R

Modellbaserad klustring

Blandningsmodeller i R

Nu kör vi en övning!

Blandningsmodeller i R

Preparing Video For Download...