カイ二乗適合度検定

Rによる仮説検定

Richie Cotton

Data Evangelist at DataCamp

紫のリンク

オンラインでコード解決策を検索し、既に閲覧済みでリンクが紫になっている最初の結果を見ます。どのように感じますか?

purple_link_counts <- stack_overflow %>% 
  count(purple_link)
# A tibble: 4 x 2
  purple_link           n
  <fct>             <int>
1 Hello, old friend  1330
2 Amused              409
3 Indifferent         426
4 Annoyed             290
Rによる仮説検定

仮説の定義

hypothesized <- tribble(
  ~ purple_link, ~ prop,
  "Hello, old friend", 1 / 2,
  "Amused"           , 1 / 6,
  "Indifferent"      , 1 / 6,
  "Annoyed"          , 1 / 6
)
# A tibble: 4 x 2
  purple_link        prop
  <chr>             <dbl>
1 Hello, old friend 0.5  
2 Amused            0.167
3 Indifferent       0.167
4 Annoyed           0.167

$H_{0}$: 標本は仮定した分布に一致する。

$H_{A}$: 標本は仮定した分布に一致しない。

検定統計量 $\chi^{2}$ は、各群で観測値が期待値からどれだけ離れているかを測ります。

alpha <- 0.01
1 tribble は「行ごとの tibble」の略。スター・トレックのエイリアン種族とは無関係です。
Rによる仮説検定

カテゴリ別の仮定カウント

n_total <- nrow(stack_overflow)
hypothesized <- tribble(
  ~ purple_link, ~ prop,
  "Hello, old friend", 1 / 2,
  "Amused"           , 1 / 6,
  "Indifferent"      , 1 / 6,
  "Annoyed"          , 1 / 6
) %>%
  mutate(n = prop * n_total)
# A tibble: 4 x 3
  purple_link        prop     n
  <chr>             <dbl> <dbl>
1 Hello, old friend 0.5   1228.
2 Amused            0.167  409.
3 Indifferent       0.167  409.
4 Annoyed           0.167  409.
Rによる仮説検定

度数の可視化

ggplot(purple_link_counts, aes(purple_link, n)) +
  geom_col() +
  geom_point(data = hypothesized, color = "purple")

紫リンクの回答ごとの件数と、仮定した件数を示す紫の点の棒グラフ

Rによる仮説検定

chisq_test() による適合度検定

hypothesized_props <- c(
  "Hello, old friend" = 1 / 2,
  Amused              = 1 / 6,
  Indifferent         = 1 / 6,
  Annoyed             = 1 / 6
)
library(infer)
stack_overflow %>% 
  chisq_test(
    response = purple_link,
    p = hypothesized_props
  )
# A tibble: 1 x 3
  statistic chisq_df       p_value
      <dbl>    <dbl>         <dbl>
1      44.0        3 0.00000000154
Rによる仮説検定

Let's practice!

Rによる仮説検定

Preparing Video For Download...