假設檢定中的假設

R 中的假設檢定

Richie Cotton

Data Evangelist at DataCamp

隨機性

假設

樣本是來自更大母體的隨機子集。

影響
  • 樣本無法代表母體。
如何檢查
  • 了解你的資料如何蒐集。
  • 與資料蒐集者/領域專家討論。

帶有「Responsibly Sourced Ingredients」字樣的標章。

1 抽樣技術可參考「Sampling in R」。
R 中的假設檢定

觀測值獨立性

假設

資料集中的每筆觀測(列)相互獨立。

影響
  • 偽陰性/偽陽性機率升高。
如何檢查
  • 了解你的資料如何蒐集。
R 中的假設檢定

大樣本量

假設

樣本夠大以降低不確定性,且可套用中央極限定理。

影響
  • 信賴區間非常寬。
  • 偽陰性/偽陽性機率升高。
如何檢查
  • 視檢定而定。
R 中的假設檢定

大樣本量:t 檢定

單一樣本
  • 樣本中至少有 30$^{1}$ 筆觀測。

$n \ge 30$

$n$:樣本數

兩個樣本
  • 每個樣本至少有 30 筆觀測。

$n_{1} \ge 30, n_{2} \ge 30$

$n_{i}$:第 $i$ 組的樣本數

成對樣本
  • 兩樣本間至少有 30 對配對觀測。

你的資料筆數 $\ge 30$

ANOVA
  • 每個樣本至少有 30 筆觀測。

對所有 $i$,$n_{i} \ge 30$

1 有時少於 30 也可行;重點是虛無分佈看起來近似常態。
R 中的假設檢定

大樣本量:比例檢定

單一樣本
  • 樣本中的成功次數 ≥ 10。

$n \times \hat{p} \ge 10$

  • 樣本中的失敗次數 ≥ 10。

$n \times (1 - \hat{p}) \ge 10$

$n$:樣本數
$\hat{p}$:樣本成功比例

兩個樣本
  • 每個樣本中的成功次數 ≥ 10。

$n_{1} \times \hat{p}_{1} \ge 10$

$n_{2} \times \hat{p}_{2} \ge 10$

  • 每個樣本中的失敗次數 ≥ 10。

$n_{1} \times (1 - \hat{p}_{1}) \ge 10$

$n_{2} \times (1 - \hat{p}_{2}) \ge 10$

R 中的假設檢定

大樣本量:卡方檢定

  • 每組的成功次數 ≥ 5。

對所有 $i$,$n_{i} \times \hat{p}_{i} \ge 5$

  • 每組的失敗次數 ≥ 5。

對所有 $i$,$n_{i} \times (1 - \hat{p}_{i}) \ge 5$

$n_{i}$:第 $i$ 組的樣本數
$\hat{p}_{i}$:第 $i$ 組樣本的成功比例

R 中的假設檢定

合理性檢查

若自助抽樣分佈看起來不像常態,這些假設很可能不成立。

R 中的假設檢定

一起來練習吧!

R 中的假設檢定

Preparing Video For Download...