选择列

Julia 中的数据操作

Katerina Zahradova

Instructor

美国最低工资

# 打印 wages
wages
2703×10 DataFrame 2678 rows omitted 5 columns omitted
Row  year   state     region   state_min_wage    state_min_wage_2020_dollars ...
     Int64  String31  String3  Float64           Float64           ...
______________________________________________________________________________
1    1968   Alabama   S        0.0               0.0               ...
2    1968   Alaska    W        2.1               15.61             ...
...
Julia 中的数据操作

如何切片

# 按列位置选择
wages[:, 1]
# 按列名选择
wages[:, "year"]
wages[:, :year]
# 按列名选择
wages.year
# 选择多列
wages[:, ["year", "state"]]
wages[:, [:year, :state]]
wages[:, [1,2]]
Julia 中的数据操作

选择列

# 选择州、年份和州最低工资

select(wages, 2, 1, 4)
2703×3 DataFrame 2678 rows omitted
Row  state     year        state_min_wage    
     String31  Int64       Float64                      
____________________________________________
1    Alabama   1968        0.0                              
2    Alaska    1968        2.1                            
...
Julia 中的数据操作

选择列

# 选择州、年份和州最低工资
select(wages, "state", :year, 4)
2703×3 DataFrame 2678 rows
Row  state     year        state_min_wage    
     String31  Int64       Float64                      
____________________________________________
1    Alabama   1968        0.0                              
2    Alaska    1968        2.1                            
...
Julia 中的数据操作

按模式选择

选择列

  • 以某字母/词开头或结尾
  • 含有子串

…在大数据集中会很麻烦

Julia 中的数据操作

按模式选择

# 所有以 state 开头的列
select(wages, Cols(startswith("state")))
2703×3 DataFrame 2702 rows omitted
Row state    state_min_wage state_min_wage_2020_dollars
    String31 Float64        Float64
__________________________________________
1   Alabama  0.0            0.0
...
Julia 中的数据操作

按模式选择

# 所有以 2020_dollars 结尾的列
select(wages, Cols(endswith("2020_dollars")))
2703x3 DataFrame 2702 rows omitted
Row state_min_wage_2020_dollars  federal_min_wage_2020_dollars  effective_min_wage_2020_dollars
    Float64                      Float64                        Float64
________________________________________________________________________________________________
1   0.0                          8.55                           8.55
...
Julia 中的数据操作

按模式选择

# 所有包含 min 的列
select(wages, Cols(contains.("min")))
2703×6 DataFrame 2702 rows omitted 3 columns omitted
Row  state_min_wage  state_min_wage_2020_dollars  federal_min_wage  ...    
     Float64         Float64                      Float64           ...
_______________________________________________________________________
1    0.0             0.0                          1.15              ...
... 
Julia 中的数据操作

正则表达式

regex = regular expressions(正则表达式)

Julia 中的数据操作

使用正则表达式

# 使用正则表达式选择
select(wages, r"min")
2703×6 DataFrame 2702 rows omitted 3 columns omitted
Row  state_min_wage  state_min_wage_2020_dollars  federal_min_wage  ...    
     Float64         Float64                      Float64           ...
_______________________________________________________________________
1    0.0             0.0                          1.15              ...
...
Julia 中的数据操作

select!() 与 select()

# 修改原始 DataFrame
select!(wages, :year, :state)

# 原始 DataFrame 已改变
println(first(wages))
DataFrameRow (2 columns)
Row  year    state     
     Int64   String31  
______________________
1    1968    Alabama
# 返回新的 DataFrame
select(wages, :year, :state)

# 原始 DataFrame 保持不变
println(first(wages))
DataFrameRow (10 columns, 7 omitted)
Row  year    state     region    ...
     Int64   String31  String3   ...
____________________________________
1    1968    Alabama   S         ...
Julia 中的数据操作

Passons à la pratique !

Julia 中的数据操作

Preparing Video For Download...