仮説検定の前提

Rによる仮説検定

Richie Cotton

Data Evangelist at DataCamp

ランダム性

前提

標本は母集団からのランダムサブセットである。

影響
  • 標本が母集団を代表しない。
確認方法
  • データの収集方法を把握する。
  • 収集者/ドメイン専門家に確認する。

「Responsibly Sourced Ingredients」というフレーズのロゴ。

1 サンプリング手法は「Sampling in R」で解説しています。
Rによる仮説検定

観測の独立性

前提

データセットの各観測(行)は独立である。

影響
  • 偽陰性/偽陽性のリスク増。
確認方法
  • データの収集方法を把握する。
Rによる仮説検定

大標本サイズ

前提

標本が十分大きく、不確実性を緩和し、中心極限定理が適用できる。

影響
  • 信頼区間が非常に広い。
  • 偽陰性/偽陽性のリスク増。
確認方法
  • 検定により異なる。
Rによる仮説検定

大標本サイズ:t検定

1標本
  • 標本の観測数が少なくとも30$^{1}$。

$n \ge 30$

$n$: 標本サイズ

2標本
  • 各標本で少なくとも30観測。

$n_{1} \ge 30, n_{2} \ge 30$

$n_{i}$: 群 $i$ の標本サイズ

対応のある標本
  • 少なくとも30組の対応観測。

データの行数 $\ge 30$

ANOVA
  • 各標本で少なくとも30観測。

$n_{i} \ge 30$ (全ての $i$)

1 30未満でも可の場合あり。重要なのは帰無分布が正規に見えること。
Rによる仮説検定

大標本サイズ:比率検定

1標本
  • 標本内の成功数が10以上。

$n \times \hat{p} \ge 10$

  • 標本内の失敗数が10以上。

$n \times (1 - \hat{p}) \ge 10$

$n$: 標本サイズ
$\hat{p}$: 標本内の成功割合

2標本
  • 各標本の成功数が10以上。

$n_{1} \times \hat{p}_{1} \ge 10$

$n_{2} \times \hat{p}_{2} \ge 10$

  • 各標本の失敗数が10以上。

$n_{1} \times (1 - \hat{p}_{1}) \ge 10$

$n_{2} \times (1 - \hat{p}_{2}) \ge 10$

Rによる仮説検定

大標本サイズ:カイ二乗検定

  • 各群の成功数が5以上。

$n_{i} \times \hat{p}_{i} \ge 5$ (全ての $i$)

  • 各群の失敗数が5以上。

$n_{i} \times (1 - \hat{p}_{i}) \ge 5$ (全ての $i$)

$n_{i}$: 群 $i$ の標本サイズ
$\hat{p}_{i}$: 群 $i$ の標本内の成功割合

Rによる仮説検定

妥当性チェック

ブートストラップ分布が正規形に見えなければ、前提が満たされていない可能性が高い。

Rによる仮説検定

Let's practice!

Rによる仮説検定

Preparing Video For Download...