giá trị p

Kiểm định giả thuyết trong R

Richie Cotton

Data Evangelist at DataCamp

Phiên tòa hình sự

  • Hai trạng thái sự thật có thể có.
    1. Bị cáo đã phạm tội.
    2. Bị cáo không phạm tội.
  • Hai phán quyết có thể có.
    1. Có tội.
    2. Vô tội.
  • Ban đầu giả định bị cáo vô tội.
  • Nếu bằng chứng "vượt quá nghi ngờ hợp lý" rằng bị cáo phạm tội thì kết luận "có tội", nếu không thì "vô tội".
Kiểm định giả thuyết trong R

Tuổi bắt đầu lập trình đầu tiên

  • age_first_code_cut phân loại thời điểm người dùng Stack Overflow bắt đầu lập trình
    1. "adult" nghĩa là bắt đầu từ 14 tuổi trở lên
    2. "child" nghĩa là bắt đầu trước 14 tuổi
  • Nghiên cứu trước cho thấy 35% lập trình viên bắt đầu lập trình khi còn nhỏ
  • Mẫu của ta có cho thấy tỷ lệ nhà khoa học dữ liệu bắt đầu khi còn nhỏ cao hơn không?
Kiểm định giả thuyết trong R

Định nghĩa

Giả thuyết là phát biểu về một tham số quần thể chưa biết.

Kiểm định giả thuyết là kiểm định hai giả thuyết cạnh tranh.

  • Giả thuyết không ($H_{0}$) là ý tưởng "đương kim vô địch".

  • Giả thuyết đối ($H_{A}$) là ý tưởng "thách thức" mới của nhà nghiên cứu.

Với bài toán của ta

  • $H_{0}$: Tỷ lệ nhà khoa học dữ liệu bắt đầu lập trình khi còn nhỏ bằng với lập trình viên (35%).
  • $H_{A}$: Tỷ lệ nhà khoa học dữ liệu bắt đầu lập trình khi còn nhỏ lớn hơn 35%.
1 "Naught" là tiếng Anh Anh cho "zero". Vì lý do lịch sử, "H-naught" là cách đọc quốc tế cho giả thuyết không.
Kiểm định giả thuyết trong R
  • Hai trạng thái sự thật có thể có.
    1. Bị cáo đã phạm tội.
    2. Bị cáo không phạm tội.
  • Hai phán quyết có thể có.
    1. Có tội.
    2. Vô tội.
  • Ban đầu giả định bị cáo vô tội.
  • Nếu bằng chứng "vượt quá nghi ngờ hợp lý" rằng bị cáo phạm tội thì kết luận "có tội", nếu không thì "vô tội".
  • Thực tế, hoặc $H_{A}$ hoặc $H_{0}$ là đúng (không đồng thời).
  • Kết luận là "bác bỏ $H_{0}$" hoặc "không bác bỏ $H_{0}$".
  • Ban đầu giả sử giả thuyết không, $H_{0}$, là đúng.
  • Nếu bằng chứng từ mẫu là "có ý nghĩa" rằng $H_{A}$ đúng, chọn $H_{A}$, ngược lại chọn $H_{0}$.

Mức ý nghĩa là phiên bản "vượt quá nghi ngờ hợp lý" trong kiểm định giả thuyết.

Kiểm định giả thuyết trong R

Kiểm định một đuôi và hai đuôi

Biểu đồ mật độ của phân phối chuẩn tắc với phần giữa bị che, chỉ hiện phần đuôi.

Kiểm định giả thuyết kiểm tra xem thống kê mẫu có nằm ở phần đuôi của phân phối không hay không.

Kiểm định Đuôi
phương án khác không hai đuôi
phương án lớn hơn không đuôi phải
phương án nhỏ hơn không đuôi trái

$H_{A}$: Tỷ lệ nhà khoa học dữ liệu bắt đầu lập trình khi còn nhỏ lớn hơn 35%.

Phương án dùng "lớn hơn", nên cần kiểm định đuôi phải.

Kiểm định giả thuyết trong R

giá trị p

  • p-value càng lớn, ủng hộ $H_{0}$ càng mạnh.
  • p-value càng nhỏ, bằng chứng chống lại $H_{0}$ càng mạnh.
  • p-value nhỏ nghĩa là thống kê nằm ở đuôi của phân phối không (phân phối của thống kê nếu giả thuyết không đúng).
    • Chữ "p" trong p-value là xác suất.
    • Với p-value, "nhỏ" nghĩa là "gần 0".
Kiểm định giả thuyết trong R

Định nghĩa p-value

p-value

xác suất quan sát được một thống kê kiểm định

cực đoan bằng hoặc hơn

so với quan sát trong mẫu gốc,

giả sử giả thuyết không đúng.

Kiểm định giả thuyết trong R

Tính z-score

prop_child_samp <- stack_overflow %>%
  summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
  pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
Kiểm định giả thuyết trong R

Tính p-value

  • pnorm() là CDF chuẩn.
  • Kiểm định đuôi trái → dùng mặc định lower.tail = TRUE.
  • Kiểm định đuôi phải → đặt lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Kiểm định giả thuyết trong R

Ayo berlatih!

Kiểm định giả thuyết trong R

Preparing Video For Download...