Kiểm định t hai mẫu

Phân tích dữ liệu khảo sát bằng Python

EbunOluwa Andrew

Data Scientist

So sánh tính dễ chịu

bắt tay

group_a.agreeableness.mean()
4.011701199563795
group_b.agreeableness.mean()
4.03669574700109
Phân tích dữ liệu khảo sát bằng Python

Định nghĩa kiểm định t hai mẫu

  • Kiểm tra liệu trung bình của hai nhóm độc lập có khác biệt có ý nghĩa
  • Xác định liệu khác biệt do ngẫu nhiên

Cặp chai dán nhãn A và B

Phân tích dữ liệu khảo sát bằng Python

Giả định cho kiểm định t hai mẫu

  • Độc lập
  • Phân phối chuẩn
    • Kiểm định Shapiro–Wilk
    • stats.shapiro()
    • p-value > 0.05 -> phân phối chuẩn
  • Phương sai bằng nhau
    • Kiểm định Levene
    • stats.levene()
    • p-value > 0.05 -> phương sai bằng nhau

Khối gỗ đánh số

Phân tích dữ liệu khảo sát bằng Python

Kết quả khảo sát

group_a

| userid | agreeableness |
|--------|---------------|
|    895 |          4.78 |
|    a06 |          3.40 |
|    e94 |          3.66 |
|    ee6 |          5.41 |
|    521 |          4.58 |
|    f4c |          3.24 |
...

1 = Không dễ chịu

group_b

| userid | agreeableness |
|--------|---------------|
|    b7e | 4.43          |
|    030 | 2.92          |
|    f91 | 4.01          |
|    36f | 2.20          |
|    875 | 3.83          |
|    750 | 4.95          |
...

7 = Dễ chịu

Phân tích dữ liệu khảo sát bằng Python

Nhóm độc lập

hai nhóm

Phân tích dữ liệu khảo sát bằng Python

Nhóm phân phối chuẩn

from scipy.stats import shapiro
import scipy.stats as stats

norm_A = stats.shapiro(
  group_a.agreeableness)

ShapiroResult(
statistic=0.997467577457428,
pvalue=0.16834689676761627)
from scipy.stats import shapiro
import scipy.stats as stats

norm_B = stats.shapiro(
  group_b.agreeableness)

ShapiroResult(
statistic=0.9987381100654602,
pvalue=0.7757995128631592)
Phân tích dữ liệu khảo sát bằng Python

Phương sai bằng nhau

import scipy.stats as stats

var_test = stats.levene(group_a.agreeableness, group_b.agreeableness)
LeveneResult(statistic=0.40492634057696597, pvalue=0.5246354858484796)
Phân tích dữ liệu khảo sát bằng Python

Đã kiểm tra giả định

  • Nhóm độc lập
    • không trùng cá thể
  • Nhóm phân phối chuẩn
  • Phương sai bằng nhau
    • không khác biệt ý nghĩa giữa hai phương sai

Apple Pencil-Ảnh của Dose Media trên Unsplash

Phân tích dữ liệu khảo sát bằng Python

Kiểm định t hai mẫu với statsmodels

from scipy import stats

stats.ttest_ind(group_a.agreeableness, group_b.agreeableness)
Phân tích dữ liệu khảo sát bằng Python

Kiểm định t hai mẫu với statsmodels

Ttest_indResult(statistic=0.7746406648066304, pvalue=0.4386519848366188)
Phân tích dữ liệu khảo sát bằng Python

Phân tích thêm

group_a_mean = 4.011701199563795
group_b_mean = 4.03669574700109

Nhà ở tại California

Phân tích dữ liệu khảo sát bằng Python

Ayo berlatih!

Phân tích dữ liệu khảo sát bằng Python

Preparing Video For Download...