ข้อสมมติในการทดสอบสมมติฐาน

Hypothesis Testing in R

Richie Cotton

Data Evangelist at DataCamp

ความสุ่ม

ข้อสมมติ

ตัวอย่างเป็นชุดข้อมูลสุ่มจากประชากรขนาดใหญ่

ผลที่ตามมา
  • ตัวอย่างอาจไม่ได้เป็นตัวแทนของประชากร
วิธีตรวจสอบ
  • ทำความเข้าใจวิธีเก็บรวบรวมข้อมูล
  • ปรึกษาผู้เก็บข้อมูลหรือผู้เชี่ยวชาญในสาขา

โลโก้ที่มีข้อความว่า 'Responsibly Sourced Ingredients'

1 เทคนิคการสุ่มตัวอย่างมีการอธิบายไว้ใน "Sampling in R"
Hypothesis Testing in R

ความเป็นอิสระของการสังเกต

ข้อสมมติ

การสังเกตแต่ละครั้ง (แถว) ในชุดข้อมูลเป็นอิสระต่อกัน

ผลที่ตามมา
  • โอกาสเกิดข้อผิดพลาดแบบลบเทียม/บวกเทียมสูงขึ้น
วิธีตรวจสอบ
  • ทำความเข้าใจวิธีเก็บรวบรวมข้อมูล
Hypothesis Testing in R

ขนาดตัวอย่างที่ใหญ่พอ

ข้อสมมติ

ขนาดตัวอย่างต้องใหญ่พอที่จะลดความไม่แน่นอน และทำให้ทฤษฎีบทลิมิตกลางใช้งานได้

ผลที่ตามมา
  • ช่วงความเชื่อมั่นกว้างมาก
  • โอกาสเกิดข้อผิดพลาดแบบลบเทียม/บวกเทียมสูงขึ้น
วิธีตรวจสอบ
  • ขึ้นอยู่กับการทดสอบที่ใช้
Hypothesis Testing in R

ขนาดตัวอย่างที่ใหญ่พอ: t-test

ตัวอย่างเดียว
  • มีการสังเกตอย่างน้อย 30$^{1}$ รายการในตัวอย่าง

$n \ge 30$

$n$: ขนาดตัวอย่าง

สองตัวอย่าง
  • มีการสังเกตอย่างน้อย 30 รายการในแต่ละตัวอย่าง

$n_{1} \ge 30, n_{2} \ge 30$

$n_{i}$: ขนาดตัวอย่างของกลุ่ม $i$

ตัวอย่างแบบจับคู่
  • มีคู่การสังเกตอย่างน้อย 30 คู่ในตัวอย่าง

จำนวนแถวในข้อมูล $\ge 30$

ANOVA
  • มีการสังเกตอย่างน้อย 30 รายการในแต่ละตัวอย่าง

$n_{i} \ge 30$ สำหรับทุกค่าของ $i$

1 บางครั้งอาจใช้จำนวนน้อยกว่า 30 ได้ สิ่งสำคัญคือ null distribution ต้องมีลักษณะเป็นโค้งปกติ
Hypothesis Testing in R

ขนาดตัวอย่างที่ใหญ่พอ: การทดสอบสัดส่วน

ตัวอย่างเดียว
  • จำนวนความสำเร็จในตัวอย่างต้องมากกว่าหรือเท่ากับ 10

$n \times \hat{p} \ge 10$

  • จำนวนความล้มเหลวในตัวอย่างต้องมากกว่าหรือเท่ากับ 10

$n \times (1 - \hat{p}) \ge 10$

$n$: ขนาดตัวอย่าง
$\hat{p}$: สัดส่วนความสำเร็จในตัวอย่าง

สองตัวอย่าง
  • จำนวนความสำเร็จในแต่ละตัวอย่างต้องมากกว่าหรือเท่ากับ 10

$n_{1} \times \hat{p}_{1} \ge 10$

$n_{2} \times \hat{p}_{2} \ge 10$

  • จำนวนความล้มเหลวในแต่ละตัวอย่างต้องมากกว่าหรือเท่ากับ 10

$n_{1} \times (1 - \hat{p}_{1}) \ge 10$

$n_{2} \times (1 - \hat{p}_{2}) \ge 10$

Hypothesis Testing in R

ขนาดตัวอย่างที่ใหญ่พอ: การทดสอบไคสแควร์

  • จำนวนความสำเร็จในแต่ละกลุ่มต้องมากกว่าหรือเท่ากับ 5

$n_{i} \times \hat{p}_{i} \ge 5$ สำหรับทุกค่าของ $i$

  • จำนวนความล้มเหลวในแต่ละกลุ่มต้องมากกว่าหรือเท่ากับ 5

$n_{i} \times (1 - \hat{p}_{i}) \ge 5$ สำหรับทุกค่าของ $i$

$n_{i}$: ขนาดตัวอย่างของกลุ่ม $i$
$\hat{p}_{i}$: สัดส่วนความสำเร็จในกลุ่มตัวอย่าง $i$

Hypothesis Testing in R

การตรวจสอบเบื้องต้น

หาก bootstrap distribution ไม่มีลักษณะปกติ ข้อสมมติอาจไม่เป็นที่ยอมรับ

Hypothesis Testing in R

มาฝึกกันเถอะ!

Hypothesis Testing in R

Preparing Video For Download...