ANOVA phi tham số và t-test độc lập

Kiểm định giả thuyết trong R

Richie Cotton

Data Evangelist at DataCamp

Kiểm định phi tham số

Kiểm định phi tham số là kiểm định giả thuyết không giả định phân phối cho thống kê kiểm định.

Có hai loại kiểm định phi tham số:

  1. Dựa trên mô phỏng.
  2. Dựa trên thứ hạng.
Kiểm định giả thuyết trong R

t_test()

$H_{0}$: $\mu_{child} - \mu_{adult} = 0$     $H_{A}$: $\mu_{child} - \mu_{adult} > 0$

library(infer)
stack_overflow %>% 
  t_test(
    converted_comp ~ age_first_code_cut,
    order = c("child", "adult"),
    alternative = "greater"
  )
# A tibble: 1 x 6
  statistic  t_df p_value alternative lower_ci upper_ci
      <dbl> <dbl>   <dbl> <chr>          <dbl>    <dbl>
1      2.40 2083. 0.00814 greater        8438.      Inf
Kiểm định giả thuyết trong R

Tính phân phối rỗng (null)

Quy trình dựa trên mô phỏng
null_distn <- stack_overflow %>% 
  specify(converted_comp ~ age_first_code_cut) %>%

hypothesize(null = "independence") %>%
generate(reps = 5000, type = "permute") %>%
calculate( stat = "diff in means", order = c("child", "adult") )
t-test để so sánh
library(infer)
stack_overflow %>% 
  t_test(
    converted_comp ~ age_first_code_cut,
    order = c("child", "adult"),
    alternative = "greater"
  )
Kiểm định giả thuyết trong R

Tính thống kê quan sát

Quy trình dựa trên mô phỏng
obs_stat <- stack_overflow %>% 
  specify(converted_comp ~ age_first_code_cut) %>% 
  calculate(
    stat = "diff in means", 
    order = c("child", "adult")
  )
t-test để so sánh
library(infer)
stack_overflow %>% 
  t_test(
    converted_comp ~ age_first_code_cut,
    order = c("child", "adult"),
    alternative = "greater"
  )
Kiểm định giả thuyết trong R

Lấy p-value

Quy trình dựa trên mô phỏng
get_p_value(
  null_distn, obs_stat, 
  direction = "greater"
)
# A tibble: 1 x 1
  p_value
    <dbl>
1  0.0066
t-test để so sánh
library(infer)
stack_overflow %>% 
  t_test(
    converted_comp ~ age_first_code_cut,
    order = c("child", "adult"),
    alternative = "greater"
  )
# A tibble: 1 x 6
  statistic  t_df p_value alternative lower_ci upper_ci
      <dbl> <dbl>   <dbl> <chr>          <dbl>    <dbl>
1      2.40 2083. 0.00814 greater        8438.      Inf
Kiểm định giả thuyết trong R

Thứ hạng của vector

x <- c(1, 15, 3, 10, 6)
rank(x)
1 5 2 4 3

Kiểm định Wilcoxon–Mann–Whitney (hay kiểm định tổng hạng Wilcoxon) về đại ý là một t-test áp dụng lên thứ hạng của dữ liệu số.

Kiểm định giả thuyết trong R

Kiểm định Wilcoxon–Mann–Whitney

wilcox.test(
  converted_comp ~ age_first_code_cut,
  data = stack_overflow,
  alternative = "greater",
  correct = FALSE
) 
    Wilcoxon rank sum test

data:  converted_comp by age_first_code_cut
W = 967298, p-value <2e-16
alternative hypothesis: true location shift is greater than 0
1 Còn gọi là "Wilcoxon rank-sum test" và "Mann-Whitney U test".
Kiểm định giả thuyết trong R

Kiểm định Kruskal–Wallis

Kruskal–Wallis so với Wilcoxon–Mann–Whitney giống như ANOVA so với t-test.

kruskal.test(
  converted_comp ~ job_sat,
  data = stack_overflow
)
    Kruskal-Wallis rank sum test

data:  converted_comp by job_sat
Kruskal-Wallis chi-square = 81, df = 4, p-value <2e-16
Kiểm định giả thuyết trong R

Ayo berlatih!

Kiểm định giả thuyết trong R

Preparing Video For Download...