Trực quan hóa mẫu dữ liệu thiếu

Xử lý dữ liệu khuyết bằng Imputation trong R

Michal Oleszak

Machine Learning Engineer

Vấn đề với cách kiểm định

  • Kiểm định thống kê để phát hiện mẫu thiếu có thể rườm rà.
  • t-test có nhiều giả định về dữ liệu.
  • Suy luận dựa trên p-value dễ gặp vấn đề (chọn mức ý nghĩa, p-hacking).
Xử lý dữ liệu khuyết bằng Imputation trong R

Trực quan hóa dữ liệu thiếu

  • Cách khác: trực quan hóa!
  • Dễ dùng.
  • Phát hiện mẫu dữ liệu thiếu.
  • Nêu bật các khía cạnh khác của chất lượng dữ liệu.

Gói VIM có bộ công cụ mạnh để vẽ dữ liệu thiếu. Trong bài này:

  • Biểu đồ tổng hợp (aggregation)
  • Biểu đồ spine
  • Biểu đồ mosaic
Xử lý dữ liệu khuyết bằng Imputation trong R

Biểu đồ tổng hợp

nhanes %>% aggr(combined = TRUE, numbers = TRUE)

Biểu đồ tổng hợp dạng lưới hiển thị mọi tổ hợp giá trị thiếu/quan sát được của các biến trong bộ dữ liệu biopics. Với mỗi tổ hợp, biểu đồ cho tỷ lệ phần trăm quan sát có mẫu thiếu tương ứng.

Xử lý dữ liệu khuyết bằng Imputation trong R

Biểu đồ spine

nhanes %>% select(Gender, TotChol) %>% spineMiss()

Biểu đồ spine gồm hai cột cho nam và nữ. Trong mỗi cột, hiển thị tỷ lệ giá trị thiếu của biến cholesterol toàn phần theo giới tính tương ứng.

Xử lý dữ liệu khuyết bằng Imputation trong R

Biểu đồ mosaic

nhanes %>% mosaicMiss(highlight = "TotChol", plotvars = c("Gender", "PhysActive"))

Biểu đồ mosaic gồm các ô ghép thành hình chữ nhật. Mỗi ô tương ứng một giá trị của "Gender" và một giá trị của "PhysActive". Trong mỗi ô, hiển thị tỷ lệ giá trị thiếu của biến cholesterol toàn phần.

Xử lý dữ liệu khuyết bằng Imputation trong R

Hãy vẽ phần bị thiếu!

Xử lý dữ liệu khuyết bằng Imputation trong R

Preparing Video For Download...