ANOVA

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

นักวิ่ง

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

ANOVA สำหรับคะแนนศัพท์เทียบกับชนชั้นทางสังคมที่ระบุตนเอง

$H_0$: คะแนนศัพท์เฉลี่ยเท่ากันในทุกชนชั้นทางสังคม $\mu_{lower} = \mu_{working} = \mu_{middle} = \mu_{upper}$

$H_A$: คะแนนศัพท์เฉลี่ยแตกต่างกันอย่างน้อยหนึ่งคู่ของชนชั้นทางสังคม

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

การแบ่งส่วนความแปรปรวน

ความแปรปรวนรวมของคะแนนศัพท์:

  • ความแปรปรวนที่เกิดจากความแตกต่างระหว่างชนชั้นทางสังคม — ความแปรปรวนระหว่างกลุ่ม
  • ความแปรปรวนที่เกิดจากปัจจัยอื่น — ความแปรปรวนภายในกลุ่ม
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

ผลลัพธ์ ANOVA

library(broom)

aov(wordsum ~ class, gss) %>%
  tidy()
term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

ผลรวมกำลังสอง

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA
  • $SST = 236.5644 + 2869.8003 = 3106.365$ — วัดความแปรปรวนรวมของตัวแปรตอบสนอง
  • คำนวณคล้ายกับความแปรปรวน (แต่ไม่ปรับด้วยขนาดตัวอย่าง)
  • เปอร์เซ็นต์ความแปรปรวนที่อธิบายได้ = $\frac{236.5644}{3106.365} = 7.6\%$
การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

F-statistic

term        df     sumsq    meansq   statistic p.value
class        3   236.5644  78.854810  21.73467       0
Residuals  791  2869.8003   3.628066        NA      NA

F-statistic = 21.73467 = $\frac{between~group~var}{within~group~var}$

F-statistic และ p-value

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

มาฝึกกันเถอะ!

การอนุมานสำหรับข้อมูลเชิงตัวเลขใน R

Preparing Video For Download...