두 표본 t-검정

Python으로 설문 데이터 분석하기

EbunOluwa Andrew

Data Scientist

우호성 비교

악수하는 사람들

group_a.agreeableness.mean()
4.011701199563795
group_b.agreeableness.mean()
4.03669574700109
Python으로 설문 데이터 분석하기

두 표본 t-검정 정의

  • 두 독립 집단의 평균이 유의하게 다른지 검정
  • 차이가 우연인지 판단

A와 B 라벨 병 두 개

Python으로 설문 데이터 분석하기

두 표본 t-검정의 가정

  • 독립적
  • 정규분포
    • Shapiro-Wilk 검정
    • stats.shapiro()
    • p-value > 0.05 -> 정규분포로 봄
  • 등분산
    • Levene 검정
    • stats.levene()
    • p-value > 0.05 -> 등분산으로 봄

나무 숫자 블록

Python으로 설문 데이터 분석하기

설문 결과

group_a

| userid | agreeableness |
|--------|---------------|
|    895 |          4.78 |
|    a06 |          3.40 |
|    e94 |          3.66 |
|    ee6 |          5.41 |
|    521 |          4.58 |
|    f4c |          3.24 |
...

1 = 비우호적

group_b

| userid | agreeableness |
|--------|---------------|
|    b7e | 4.43          |
|    030 | 2.92          |
|    f91 | 4.01          |
|    36f | 2.20          |
|    875 | 3.83          |
|    750 | 4.95          |
...

7 = 우호적

Python으로 설문 데이터 분석하기

독립 표본

두 그룹

Python으로 설문 데이터 분석하기

정규분포 가정 충족

from scipy.stats import shapiro
import scipy.stats as stats

norm_A = stats.shapiro(
  group_a.agreeableness)

ShapiroResult(
statistic=0.997467577457428,
pvalue=0.16834689676761627)
from scipy.stats import shapiro
import scipy.stats as stats

norm_B = stats.shapiro(
  group_b.agreeableness)

ShapiroResult(
statistic=0.9987381100654602,
pvalue=0.7757995128631592)
Python으로 설문 데이터 분석하기

등분산 가정

import scipy.stats as stats

var_test = stats.levene(group_a.agreeableness, group_b.agreeableness)
LeveneResult(statistic=0.40492634057696597, pvalue=0.5246354858484796)
Python으로 설문 데이터 분석하기

가정 확인 완료

  • 독립 표본
    • 개인 간 중복 없음
  • 정규분포 가정 충족
  • 등분산 가정
    • 두 분산 간 유의한 차이 없음

Apple Pencil-Unsplash의 Dose Media 사진

Python으로 설문 데이터 분석하기

scipy로 두 표본 t-검정

from scipy import stats

stats.ttest_ind(group_a.agreeableness, group_b.agreeableness)
Python으로 설문 데이터 분석하기

scipy로 두 표본 t-검정

Ttest_indResult(statistic=0.7746406648066304, pvalue=0.4386519848366188)
Python으로 설문 데이터 분석하기

추가 분석

group_a_mean = 4.011701199563795
group_b_mean = 4.03669574700109

캘리포니아의 주택

Python으로 설문 데이터 분석하기

Let's practice!

Python으로 설문 데이터 분석하기

Preparing Video For Download...