분리 측정: 불균등지수

Python으로 미국 인구조사 데이터 분석하기

Lee Hachadoorian

Asst. Professor of Instruction, Temple University

분리란 무엇인가?

시카고 점 밀도 지도. 백인, 흑인, 아시아계, 히스패닉을 네 가지 색으로 표시. 같은 색 점이 서로 모여 인종별 분리가 나타남.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$\color{red}D = \frac{1}{2}\sum_i{\left\lvert \frac{{a_i}}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \color{red}{\frac{a_i}{A}} \color{white}{- \frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \color{red}{\frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{red}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \color{white}{\frac{1}{2}}\color{red}{\sum_i}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \color{red}{\frac{1}{2}}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

불균등지수 공식

두 집단 A와 B가 주어질 때:

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = 소지역의 A 집단 수
  • $b_i$ = 소지역의 B 집단 수
  • $A$ = 대지역의 A 집단 수
  • $B$ = 대지역의 B 집단 수

네 사분면으로 나뉜 상자에 각 사분면의 A와 B 인구가 표시됨.

Python으로 미국 인구조사 데이터 분석하기

적합한 데이터

tracts.head()
  state county   tract  white  black
0    01    001  020100   1601    217
1    01    001  020200    844   1214
2    01    001  020300   2538    647
3    01    001  020400   4030    191
4    01    001  020500   8438   1418

출처: 표 P5 - 2010 인구총조사

  • white = 비히스패닉 백인 인구
  • black = 비히스패닉 흑인 인구
Python으로 미국 인구조사 데이터 분석하기

불균등지수(D) 계산

# 주 FIPS "06"으로 캘리포니아 트랙트 추출
ca_tracts = tracts[tracts["state"] == "06"]

# 열 이름을 편의 변수로 저장 w = "white" b = "black"
Python으로 미국 인구조사 데이터 분석하기

불균등지수(D) 계산

# 캘리포니아 모든 트랙트의 흑인 인구 합계 출력
print(ca_tracts[b].sum())
2163804
# 캘리포니아 모든 트랙트의 백인 인구 합계 출력
print(ca_tracts[w].sum())
14956253
Python으로 미국 인구조사 데이터 분석하기

불균등지수(D) 계산

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

# 불균등지수 계산
print(0.5 * sum(abs(
  ca_tracts[w] / ca_tracts[w].sum() - ca_tracts[b] / ca_tracts[b].sum()
  )))
0.6033425039167011
Python으로 미국 인구조사 데이터 분석하기

Ayo berlatih!

Python으로 미국 인구조사 데이터 분석하기

Preparing Video For Download...