美国社区调查:年度变化

使用 Python 分析美国人口普查数据

Lee Hachadoorian

Asst. Professor of Instruction, Temple University

普查历史:总计与抽样

核心人口特征的总计:

  • 十年一次人口普查 1790–2010+

广泛社会与经济特征的抽样:

  • 十年一次人口普查"长表"(SF3)1970–2000,约15%家庭
  • 年度美国社区调查 2005+,约1%家庭
使用 Python 分析美国人口普查数据

B25045 - 按年龄分的居住权 × 可用车辆数

Variable   |  Label
-----------|--------------------------------------
B25045001  |  合计
B25045002  |    自有住房
B25045003  |      无可用车辆
B25045004  |        户主 15–34 岁
B25045005  |        户主 35–64 岁
B25045006  |        户主 65 岁及以上
B25045007  |      有1辆或以上车辆
B25045008  |        户主 15–34 岁
B25045009  |        户主 35–64 岁
B25045010  |        户主 65 岁及以上
B25045011  |    租住房
B25045012  |      无可用车辆
B25045013  |        户主 15–34 岁
B25045014  |        户主 35–64 岁
B25045015  |        户主 65 岁及以上
B25045016  |      有1辆或以上车辆
B25045017  |        户主 15–34 岁
B25045018  |        户主 35–64 岁
B25045019  |        户主 65 岁及以上
使用 Python 分析美国人口普查数据

ACS 详细表请求——设置

import requests
import pandas as pd

HOST, dataset = "https://api.census.gov/data", "acs/acs1"

get_vars = ["B25045_" + str(i + 1).zfill(3) + "E" for i in range(19)] get_vars = ["NAME"] + get_vars
print(get_vars)
['NAME', 'B25045_001E', 'B25045_002E', 'B25045_003E', 'B25045_004E', 
'B25045_005E', 'B25045_006E', 'B25045_007E', 'B25045_008E', 'B25045_009E', 
'B25045_010E', 'B25045_011E', 'B25045_012E', 'B25045_013E', 'B25045_014E', 
'B25045_015E', 'B25045_016E', 'B25045_017E', 'B25045_018E', 'B25045_019E']
使用 Python 分析美国人口普查数据

ACS 详细表请求——设置

import requests
import pandas as pd

HOST, dataset = "https://api.census.gov/data", "acs/acs1"

get_vars = ["B25045_" + str(i + 1).zfill(3) + "E" for i in range(19)] get_vars = ["NAME"] + get_vars
# print(get_vars)
predicates = {} predicates["get"] = ",".join(get_vars) predicates["for"] = "us:*"
使用 Python 分析美国人口普查数据

跨多年请求相同变量

# Initialize DataFrame collector
dfs = []

for year in range(2011, 2018):
base_url = "/".join([HOST, str(year), dataset]) r = requests.get(base_url, params=predicates)
df = pd.DataFrame(columns=r.json()[0], data=r.json()[1:])
# Add column to hold year value df["year"] = year
dfs.append(df)
# Concatenate all DataFrames in collector us = pd.concat(dfs, ignore_index=True)
使用 Python 分析美国人口普查数据

跨多年请求相同变量

print(us.head())
            NAME B25045_001E B25045_002E  ... B25045_019E us  year
0  United States   114991725    74264435  ...     3232812  1  2011
1  United States   115969540    74119256  ...     3447172  1  2012
2  United States   116291033    73843861  ...     3662322  1  2013
3  United States   117259427    73991995  ...     3847400  1  2014
4  United States   118208250    74506512  ...     4044430  1  2015

[5 rows x 22 columns]
使用 Python 分析美国人口普查数据

获取一些数据!

使用 Python 分析美国人口普查数据

Preparing Video For Download...