การประมาณค่าด้วย t-interval

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

การวัดความแปรปรวนของค่าเฉลี่ยตัวอย่าง

สมมติว่าในกลุ่มตัวอย่างแบบสุ่ม 100 คน มี 13 คนที่ถนัดซ้าย หากสุ่มตัวอย่างใหม่อีก 100 คน จะแปลกใจไหมถ้าพบแค่ 12 คน? แล้วถ้าเป็น 15? หรือ 30? หรือ 1 หรือ 90?

วิธีวัดความแปรปรวนของค่าเฉลี่ยตัวอย่าง:

  • จำลองด้วย bootstrapping

  • ประมาณด้วย Central Limit Theorem

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

Central Limit Theorem

$$ \bar{x} \sim N \left( mean = \mu, SE = \frac{\sigma}{\sqrt{n}} \right) $$

  • SE (standard error) = ส่วนเบี่ยงเบนมาตรฐานของการแจกแจงตัวอย่าง
  • $\sigma$ ไม่ทราบค่า:
    • $SE = \frac{s}{\sqrt{n}}$
    • ใช้ $t_{df = n - 1}$ สำหรับการอนุมานค่าเฉลี่ย
  • ใช้ได้เฉพาะเมื่อเงื่อนไขบางประการเป็นจริง...
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

เงื่อนไข

  1. การสังเกตอิสระต่อกัน: ตรวจสอบได้ยาก แต่...
    • การสุ่มตัวอย่าง / การกำหนดกลุ่มแบบสุ่ม
    • หากสุ่มแบบไม่ใส่คืน ต้องมี n < 10% ของประชากร
  2. ขนาดตัวอย่าง / ความเบ้: ยิ่งประชากรเบ้มาก ขนาดตัวอย่างที่ต้องการยิ่งมากขึ้น
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

ช่วงความเชื่อมั่นสำหรับค่าเฉลี่ย

ประมาณค่าเฉลี่ยจำนวนวันที่ชาวอเมริกันทำงานเกินเวลา (ตัวแปร: moredays) โดยใช้ข้อมูลจาก General Social Survey ปี 2010 (ข้อมูล: gss)

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

ช่วงความเชื่อมั่นสำหรับค่าเฉลี่ย

ประมาณค่าเฉลี่ยจำนวนวันที่ชาวอเมริกันทำงานเกินเวลา (ตัวแปร: moredays) โดยใช้ข้อมูลจาก General Social Survey ปี 2010 (ข้อมูล: gss)

t.test(gss$moredays, conf.level = 0.95)
    One Sample t-test
data:  gss$moredays
t = 25.628, df = 1146, p-value < 2.2e-16
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
 5.273367 6.147732
sample estimates:
mean of x 
 5.710549
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

มาฝึกกันเถอะ!

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

Preparing Video For Download...