Mesurer la ségrégation : l'indice de dissimilarité

Analyser les données du recensement des États-Unis avec Python

Lee Hachadoorian

Asst. Professor of Instruction, Temple University

Qu'est-ce que la ségrégation ?

Carte par points de Chicago montrant les populations blanche, noire, asiatique et hispanique en quatre couleurs. Les points de même couleur sont regroupés, ce qui suggère un paysage ségrégué selon la race.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$\color{white}{D = {\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$\color{red}D = \frac{1}{2}\sum_i{\left\lvert \frac{{a_i}}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \color{red}{\frac{a_i}{A}} \color{white}{- \frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \color{white}{\frac{1}{2}\sum_i}\color{white}{\left\lvert \frac{a_i}{A} - \color{red}{\frac{b_i}{B}} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \color{white}{\frac{1}{2}\sum_i}\color{red}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \color{white}{\frac{1}{2}}\color{red}{\sum_i}{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \color{red}{\frac{1}{2}}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Formule de l'indice de dissimilarité

Étant donné deux groupes A et B :

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

  • $a_i$ = Effectif du groupe A dans une petite zone
  • $b_i$ = Effectif du groupe B dans une petite zone
  • $A$ = Effectif du groupe A dans la grande zone
  • $B$ = Effectif du groupe B dans la grande zone

Boîte divisée en quatre quadrants, montrant les populations de A et B dans chaque quadrant.

Analyser les données du recensement des États-Unis avec Python

Démarches de données appropriées

tracts.head()
  state county   tract  white  black
0    01    001  020100   1601    217
1    01    001  020200    844   1214
2    01    001  020300   2538    647
3    01    001  020400   4030    191
4    01    001  020500   8438   1418

Source : tableau P5 – Recensement décennal 2010

  • white = population blanche non hispanique
  • black = population noire non hispanique
Analyser les données du recensement des États-Unis avec Python

Calcul de l'indice de dissimilarité (D)

# Extraire les secteurs de Californie au moyen du FIPS d'État "06"
ca_tracts = tracts[tracts["state"] == "06"]

# Définir des variables pratiques pour contenir les noms de colonnes w = "white" b = "black"
Analyser les données du recensement des États-Unis avec Python

Calcul de l'indice de dissimilarité (D)

# Afficher la somme de la population noire pour tous les secteurs de Californie
print(ca_tracts[b].sum())
2163804
# Afficher la somme de la population blanche pour tous les secteurs de Californie
print(ca_tracts[w].sum())
14956253
Analyser les données du recensement des États-Unis avec Python

Calcul de l'indice de dissimilarité (D)

$$D = \frac{1}{2}\sum_i{\left\lvert \frac{a_i}{A} - \frac{b_i}{B} \right\rvert}$$

# Calculer l'indice de dissimilarité
print(0.5 * sum(abs(
  ca_tracts[w] / ca_tracts[w].sum() - ca_tracts[b] / ca_tracts[b].sum()
  )))
0.6033425039167011
Analyser les données du recensement des États-Unis avec Python

Passons à la pratique !

Analyser les données du recensement des États-Unis avec Python

Preparing Video For Download...