R による数値データの推測
Mine Cetinkaya-Rundel
Associate Professor of the Practice, Duke University
高校・その後の調査から200件のデータが無作為にサンプリングされた。同じ生徒が読解テストと作文テストを受けている。読解スコアと作文スコアの分布の類似点と相違点は何か?

ある生徒の読解スコアと作文スコアは、互いに独立と見なせるか?
おそらく独立ではない!
2つの観測値の組に特別な対応関係(非独立)がある場合、対応データと呼ばれる。
対応データを分析する際は、各ペアの差を算出すると有用である:
diff = read − write。
| student | read | write | diff |
|---|---|---|---|
| 1 | 57 | 52 | 5 |
| 2 | 68 | 59 | 9 |
| 3 | 44 | 33 | 11 |
| ... | ... | ... | ... |
| 200 | 63 | 65 | -2 |
読解スコアと作文スコアの平均差に対する95%信頼区間を構築する。
読解スコアと作文スコアの平均差に対する95%信頼区間を構築する。
t.test(hsb2$diff, conf.level = 0.95)
読解スコアと作文スコアの平均差に対する95%信頼区間を構築する。
t.test(hsb2$diff, conf.level = 0.95)
One Sample t-test
data: hsb2$diff
t = -0.86731, df = 199, p-value = 0.3868
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
-1.7841424 0.6941424
sample estimates:
mean of x
-0.545
読解・作文スコアの平均差(read - write)の95% CI:(-1.78, 0.69)
vs.
平均読解スコアは、平均作文スコアより1.78ポイント低い~0.69ポイント高い範囲にあると95%の信頼度で言える。
R による数値データの推測