Julia로 하는 데이터 조작
Katerina Zahradova
Instructor
# 결측값이 있는지 확인
describe(penguins, :nmissing)
7×2 DataFrame
Row variable nmissing
Symbol Int64
_________________________________
1 species 0
2 island 5
3 culmen_length_mm 0
4 culmen_depth_mm 0
5 flipper_length_mm 0
6 body_mass_g 23
7 sex 0
# 결측값이 있는 행 찾기
penguins[ismissing.(penguins.island),:]
5x7 DataFrame
Row species island culmen_length_mm culmen_depth_mm ...
String15 String15 Float64 Float64 ...
___________________________________________________________________
1 Adelie missing 39.5 17.4 ...
2 Adelie missing 40.3 18.0 ...
3 Chinstrip missing 46.7 18.3 ...
4 Gentoo missing 49.3 13.6 ...
5 Gentoo missing 43.9 17.8 ...
# 결측값이 있는 행 찾기
penguins[ismissing.(penguins.island), :species, :sex]
5x3 DataFrame
Row species island sex
String15 String15 String7
________________________________
1 Adelie missing MALE
2 Adelie missing FEMALE
3 Chinstrip missing MALE
4 Gentoo missing MALE
5 Gentoo missing FEMALE
# 모든 결측값 삭제
dropmissing!(penguins)
describe(penguins)
7×2 DataFrame
Row variable nmissing
Symbol Int64
1 species 0
2 island 0
3 culmen_length_mm 0
4 culmen_depth_mm 0
5 flipper_length_mm 0
6 body_mass_g 0
7 sex 0
# island 열의 결측값만 삭제
dropmissing!(penguins, :island)
describe(penguins)
7×2 DataFrame
Row variable nmissing
Symbol Int64
1 species 0
2 island 0
3 culmen_length_mm 0
4 culmen_depth_mm 0
5 flipper_length_mm 0
6 body_mass_g 23
7 sex 0
# 결측값을 특정 값으로 대체
replace!(penguins.body_mass_g, missing => 0)
# 결측값을 평균으로 대체
replace!(penguins.body_mass_g, missing => mean(skipmissing(penguins.body_mass_g)))

# 그룹별로 순회하며 각 그룹의 반올림한 평균으로 대체
for group in groupby(penguins, :species)
group[ismissing.(group.body_mass_g), :body_mass_g] .= round(mean(skipmissing(group.body_mass_g)))
end
# 결측값 확인
describe(penguins, :nmissing)
7×2 DataFrame
Row variable nmissing
Symbol Int64
1 species 0
...
6 body_mass_g 0
7 sex 0
# 더 많은 그룹으로 순회하며 각 그룹의 반올림한 평균으로 대체
for group in groupby(penguins, [:species, :sex])
group[ismissing.(group.body_mass_g), :body_mass_g] .= round(mean(skipmissing(group.body_mass_g)))
end
# 그룹에 레코드가 없는 경우는?
for group in groupby(penguins, [:species, :sex, :flipper_length_mm, :culmen_length_mm])
group[ismissing.(group.body_mass_g), :body_mass_g] .= round(mean(skipmissing(group.body_mass_g)))
end
ArgumentError: median of an empty array is undefined, Any[]
ismissing(var): var = missing이면 true, 아니면 falseismissing.(df.col): true/false 벡터 반환df[ismissing.(df.col),:]: col이 missing인 행 반환dropmissing(df): missing이 있는 모든 행 삭제dropmissing!(df, :col): col에 missing이 있는 행 삭제; df를 수정함replace!(df.col, missing => mean(skipmissing(df.col))): col의 missing을 col의 평균으로 대체함(결측 건은 건너뜀) missing을 대체하려면for group in groupby(df, :col)
group[ismissing.(group.col),:col] = value # 또는 그룹 평균으로
end
Julia로 하는 데이터 조작