Odczytywanie danych wielowymiarowych

Wielowymiarowe rozkłady prawdopodobieństwa w R

Surajit Ray

Professor, University of Glasgow

Tematy kursu

  • Odczytywanie i analiza danych wielowymiarowych
  • Techniki wizualizacji danych
  • Typowe rozkłady statystyczne

    • Rozkład Gaussa i t-Studenta
  • Metody dla danych wysokowymiarowych

    • Analiza głównych składowych (PCA)
Wielowymiarowe rozkłady prawdopodobieństwa w R

Struktura danych wielowymiarowych

  • Struktura prostokątna – wiersze i kolumny
    • Wiersze reprezentują obserwacje
    • Kolumny reprezentują zmienne
  • Mogą, ale nie muszą zawierać:
    • Nazwy lub numery wierszy
    • Nagłówki kolumn
  • Możliwe braki danych
Wielowymiarowe rozkłady prawdopodobieństwa w R

Przykłady danych wielowymiarowych

Dane Iris z witryny Uniwersytetu Cambridge

5.1  3.5  1.4  0.2  1
4.9  3.0  1.4  0.2  1
4.7  3.2  1.3  0.2  1

Dane Birth Weight (CSV z nagłówkiem kolumn)

"","case","bwt","gestation","parity","age","height","weight","smoke"
"1",1,120,284,0,27,62,100,0
"2",2,113,282,0,33,64,135,0
Wielowymiarowe rozkłady prawdopodobieństwa w R

Wczytywanie danych

Z adresu URL

iris_url <- "https://mlg.eng.cam.ac.uk/teaching/3f3/1011/iris.data"
iris_raw <- read.table(iris_url,  sep = "", header = FALSE)

Lokalnie

iris_raw <- read.table("iris.txt", sep = "", header = FALSE)
Wielowymiarowe rozkłady prawdopodobieństwa w R

Podgląd zbioru danych

head(iris_raw, n = 4)
     V1  V2  V3  V4 V5
1   5.1 3.5 1.4 0.2  1  
2   4.9 3.0 1.4 0.2  1  
3   4.7 3.2 1.3 0.2  1  
4   4.6 3.1 1.5 0.2  1
Wielowymiarowe rozkłady prawdopodobieństwa w R

Przypisywanie nazw kolumn

colnames(iris_raw) <- c("Sepal.Length", "Sepal.Width", "Petal.Length","Petal.Width", "Species" )
head(iris_raw)
  Sepal.Length Sepal.Width Petal.Length Petal.Width Species
1          5.1         3.5          1.4         0.2       1
2          4.9         3.0          1.4         0.2       1
3          4.7         3.2          1.3         0.2       1
4          4.6         3.1          1.5         0.2       1
5          5.0         3.6          1.4         0.2       1
6          5.4         3.9          1.7         0.4       1
Wielowymiarowe rozkłady prawdopodobieństwa w R

Dostęp do wybranych kolumn

Sprawdzenie bieżących nazw kolumn

names(iris_raw)
"Sepal.Length" "Sepal.Width"  "Petal.Length" "Petal.Width"  "Species"

$$

Dostęp do kolumn Sepal.Length i Sepal.Width

iris_raw[, 1:2] 
iris[, c('Sepal.Length', 'Sepal.Width')]
Wielowymiarowe rozkłady prawdopodobieństwa w R

Zmiana typów danych

Zmiana zmiennej Species na typ factor

iris_raw$species <- as.factor(iris_raw$species)
str(iris_raw)
'data.frame':    150 obs. of  5 variables:
 $ Sepal.Length: num  5.1 4.9 4.7 4.6 5 5.4 4.6 5 4.4 4.9 ...
 $ Sepal.Width : num  3.5 3 3.2 3.1 3.6 3.9 3.4 3.4 2.9 3.1 ...
 $ Petal.Length: num  1.4 1.4 1.3 1.5 1.4 1.7 1.4 1.5 1.4 1.5 ...
 $ Petal.Width : num  0.2 0.2 0.2 0.2 0.2 0.4 0.3 0.2 0.2 0.1 ...
 $ Species     : Factor w/ 3 levels "1","2","3": 1 1 1 1 1 1 1 1 1 1 ...
Wielowymiarowe rozkłady prawdopodobieństwa w R

Przypisywanie etykiet factor

Przekodowanie etykiet gatunków z 1, 2 i 3 na setosa, versicolor i virginica

  • Przypisanie etykiet factor
  • Zmiana pierwszej zmiennej na typ factor
library(car) 
iris_raw$Species <- recode(iris_raw$Species,
                          " 1 ='setosa'; 2 = 'versicolor'; 3 = 'virginica'")
str(iris_raw)
'data.frame':    150 obs. of  5 variables:
 $ Sepal.Length: num  5.1 4.9 4.7 4.6 5 5.4 4.6 5 4.4 4.9 ...
 $ Sepal.Width : num  3.5 3 3.2 3.1 3.6 3.9 3.4 3.4 2.9 3.1 ...
 $ Petal.Length: num  1.4 1.4 1.3 1.5 1.4 1.7 1.4 1.5 1.4 1.5 ...
 $ Petal.Width : num  0.2 0.2 0.2 0.2 0.2 0.4 0.3 0.2 0.2 0.1 ...
 $ Species     : Factor w/ 3 levels "setosa","versicolor",..: 1 1 1 1 1 1 1 1 1 1 ...
Wielowymiarowe rozkłady prawdopodobieństwa w R

Wczytywanie danych CSV z nazwami kolumn

Dane Birth Weight (CSV z nagłówkiem kolumn)

"","case","bwt","gestation","parity","age","height","weight","smoke"
"1",1,120,284,0,27,62,100,0
"2",2,113,282,0,33,64,135,0
"3",3,128,279,0,28,64,115,1

Wczytywanie danych Birth Weight

bwt <- read.csv("birthweight.csv", row.names = 1)
head(bwt, n = 3)
  case bwt gestation parity age height weight smoke
1    1 120       284      0  27     62    100     0
2    2 113       282      0  33     64    135     0
3    3 128       279      0  28     64    115     1
Wielowymiarowe rozkłady prawdopodobieństwa w R

Czas wczytać dane wielowymiarowe!

Wielowymiarowe rozkłady prawdopodobieństwa w R

Preparing Video For Download...