R에서 확장 가능한 데이터 처리
Michael Kane
Assistant Professor, Yale University

완전 무작위 결측
무작위 결측
비무작위 결측
결측값 처리의 전체 내용은 이 과정의 범위를 벗어남
데이터가 MCAR인지 확인하고 결측값 제거
# Our dependent variable is_missing <- rbinom(1000, 1, 0.5)# Our independent variables data_matrix <- matrix(rnorm(1000*10), nrow = 1000, ncol = 10) # A vector of p-values we'll fill in p_vals <- rep(NA, ncol(data_matrix))
# Perform logistic regression for (j in 1:ncol(data_matrix)) { s <- summary(glm(is_missing ~ data_matrix[, j]), family = binomial) p_vals[j] <- s$coefficients[2, 4] }# Show the p-values p_vals
0.5930082 0.7822695 0.7560343 0.3689330 0.8757048
0.8812320 0.8281008 0.4888898 0.4781299 0.5655739
R에서 확장 가능한 데이터 처리