pandas 中的分类数据

在 Python 中处理分类数据

Kasey Jones

Research Data Scientist

dtypes:object

adult = pd.read_csv("data/adult.csv")
adult.dtypes
Age                 int64
Workclass          object
fnlgwt              int64
Education          object
Education Num       int64
Marital Status     object
Occupation         object
Relationship       object
...
在 Python 中处理分类数据

dtypes:categorical

默认 dtype:

adult["Marital Status"].dtype
dtype('O')

设为分类:

adult["Marital Status"] = adult["Marital Status"].astype("category")
adult["Marital Status"].dtype
CategoricalDtype(categories=[' Divorced', ' Married-AF-spouse',
' Married-civ-spouse', ' Married-spouse-absent', ' Never-married',
' Separated', ' Widowed'], ordered=False)
在 Python 中处理分类数据

创建分类 Series

my_data = ["A", "A", "C", "B", "C", "A"]
my_series1 = pd.Series(my_data, dtype="category")
print(my_series1)
0    A
1    A
2    C
...
dtype: category
Categories (3, object): [A, B, C]
在 Python 中处理分类数据

创建分类 Series

my_data = ["A", "A", "C", "B", "C", "A"]
my_series2 = pd.Categorical(my_data, categories=["C", "B", "A"], ordered=True)
my_series2
[A, A, C, B, C, A]
Categories (3, object): [C < B < A]
在 Python 中处理分类数据

为何用分类:内存

内存优化:

adult = pd.read_csv("data/adult.csv")
adult["Marital Status"].nbytes
260488
adult["Marital Status"] = adult["Marital Status"].astype("category")
adult["Marital Status"].nbytes
32617
在 Python 中处理分类数据

读取数据时指定 dtypes

  1. 创建字典:

    adult_dtypes = {"Marital Status": "category"}
    
  2. 设置 dtype 参数:

    adult = pd.read_csv("data/adult.csv", dtype=adult_dtypes)
    
  3. 检查 dtype

    adult["Marital Status"].dtype
    
CategoricalDtype(categories=[' Divorced', ' Married-AF-spouse',
                             ..., ' Widowed'], ordered=False)
在 Python 中处理分类数据

pandas 分类练习

在 Python 中处理分类数据

Preparing Video For Download...