Algebră liniară pentru știința datelor în R
Eric Eager
Data Scientist at Pro Football Focus
Matricea $A^T$, transpusa lui $A$, se obține prin interschimbarea liniilor și coloanelor lui $A$.
Dacă setul de date se află în matricea $A$ și media fiecărei coloane a fost scăzută din fiecare element al coloanei respective, atunci elementul $i,j$ al matricei
$$\frac{A^TA}{n - 1},$$
unde $n$ este numărul de linii ale lui $A$, reprezintă covarianța dintre variabilele din coloana $i$ și coloana $j$ ale datelor.
Prin urmare, elementul $i$ de pe diagonala lui $\frac{A^TA}{n - 1}$ este varianța coloanei $i$ a matricei.
print(A)
[,1] [,2]
[1,] 1 2
[2,] 2 4
[3,] 3 6
[4,] 4 8
[5,] 5 10
A[, 1] <- A[, 1] - mean(A[, 1])
A[, 2] <- A[, 2] - mean(A[, 2])
print(A)
[,1] [,2]
[1,] -2 -4
[2,] -1 -2
[3,] 0 0
[4,] 1 2
[5,] 2 4
t(A)%*%A/(nrow(A) - 1)
[,1] [,2]
[1,] 2.5 5
[2,] 5.0 10
cov(A[, 1], A[, 2])
5
var(A[, 1])
2.5
var(A[, 2])
10
Valorile proprii $\lambda_1, \lambda_2, ... \lambda_n$ ale lui $\frac{A^TA}{n - 1}$ sunt reale, iar vectorii proprii corespunzători sunt ortogonali, adică indică direcții distincte.
Varianța totală a setului de date este suma valorilor proprii ale lui $\frac{A^TA}{n - 1}$.
Acești vectori proprii $v_1, v_2, ..., v_n$ se numesc componente principale ale setului de date din matricea $A$.
Direcția lui $v_j$ poate explica $\lambda_j$ din varianța totală. Dacă $\lambda_j$ sau un subset din $\lambda_1, \lambda_2, ... \lambda_n$ explică o parte semnificativă a varianței totale, există oportunitate de reducere a dimensionalității.
eigen(t(A)%*%A/(nrow(A) - 1))
eigen() decomposition
$`values`
[1] 12.5 0.0
$vectors
[,1] [,2]
[1,] 0.4472136 -0.8944272
[2,] 0.8944272 0.4472136
Algebră liniară pentru știința datelor în R