การวัดการแบ่งแยก: ดัชนีความไม่เหมือนกัน

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

Lee Hachadoorian

Asst. Professor of Instruction, Temple University

การแบ่งแยกคืออะไร?

แผนที่ความหนาแน่นจุดของชิคาโก แสดงประชากรผิวขาว ผิวดำ เอเชีย และฮิสแปนิกด้วยสี่สีต่างกัน จุดสีเดียวกันรวมกลุ่มใกล้กัน สะท้อนให้เห็นภูมิทัศน์ที่แบ่งแยกตามเชื้อชาติ

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$\color{red}D = \frac{1}{2}\sum_i{\left\lvert \frac{{a_i}}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \color{red}{\frac{a_i}{A}} \color{white}{- \frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \color{red}{\frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \color{white}{\frac{1}{2}\sum_i}\color{red}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \color{white}{\frac{1}{2}}\color{red}{\sum_i}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \color{red}{\frac{1}{2}}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

สูตรดัชนีความไม่เหมือนกัน

กำหนดให้มีสองกลุ่ม A และ B:

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = จำนวนกลุ่ม A ในพื้นที่ย่อย
  • $b_i$ = จำนวนกลุ่ม B ในพื้นที่ย่อย
  • $A$ = จำนวนกลุ่ม A ในพื้นที่รวม
  • $B$ = จำนวนกลุ่ม B ในพื้นที่รวม

กล่องแบ่งออกเป็นสี่ช่อง แสดงประชากรกลุ่ม A และ B ในแต่ละช่อง

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

ข้อมูลที่เหมาะสม

tracts.head()
  state county   tract  white  black
0    01    001  020100   1601    217
1    01    001  020200    844   1214
2    01    001  020300   2538    647
3    01    001  020400   4030    191
4    01    001  020500   8438   1418

ที่มา: Table P5 - 2010 Decennial Census

  • white = ประชากรผิวขาว (ไม่ใช่ฮิสแปนิก)
  • black = ประชากรผิวดำ (ไม่ใช่ฮิสแปนิก)
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

การคำนวณดัชนีความไม่เหมือนกัน (D)

# Extract California tracts using state FIPS "06"
ca_tracts = tracts[tracts["state"] == "06"]

# Define convenience variables to hold column names w = "white" b = "black"
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

การคำนวณดัชนีความไม่เหมือนกัน (D)

# Print the sum of Black population for all tracts in California
print(ca_tracts[b].sum())
2163804
# Print the sum of White population for all tracts in California
print(ca_tracts[w].sum())
14956253
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

การคำนวณดัชนีความไม่เหมือนกัน (D)

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

# Calculate Index of Dissimilarity
print(0.5 * sum(abs(
  ca_tracts[w] / ca_tracts[w].sum() - ca_tracts[b] / ca_tracts[b].sum()
  )))
0.6033425039167011
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

มาฝึกกันเถอะ!

การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python

Preparing Video For Download...