재표집과 집계

R로 시계열 데이터 다루기

Harrison Brown

Graduate Researcher in Geography

샘플링 빈도

빈도:

  • 연간 관측치 수
  • 예: 주간, 일간, 월간 ...

시간 해상도:

  • “고해상도”: 자주 샘플링
  • “저해상도”: 드물게 샘플링
  • “고/저”는 상대적 개념

개념도: 두 개의 그리드(저해상도 vs 고해상도). 더 자주/덜 자주 샘플링하는 개념을 보여줍니다.

R로 시계열 데이터 다루기

집계

  • 고해상도 -> 저해상도
  • 선택한 구간에 mean, sum, max 등 적용
  • 예:
    • 일별 데이터의 월별 sum
    • 시간별 값의 주간 mean
    • ...
  • 집계는 ‘역변환’ 불가
  • 월별 합계 -> 일별 값?
  • 패턴을 요약하는 통계 제공
  • 집계는 정보가 줄어듭니다
R로 시계열 데이터 다루기

xts로 데이터 집계

xts:

  • eXtensible Time Series
  • zoo 패키지와 zoo 클래스 확장
  • apply.*() 함수
yearly_mean <-
  apply.yearly(x = maunaloa,
               FUN = mean)
autoplot(yearly_mean) + 
  labs(...)

마우나 로아 데이터셋의 연간 평균으로 집계한 그래프. 원자료의 연중 변동성이 강했던 것과 달리, 표본 해상도가 낮아져 매우 매끄러운 선입니다.

R로 시계열 데이터 다루기

xts로 데이터 집계

마우나 로아 시계열 그래프. 주간 채집한 이산화탄소 농도를 나타냅니다. 전반적으로 증가 추세이며, 매년 계절적 피크가 있습니다.

마우나 로아 데이터셋의 연간 평균으로 집계한 그래프. 원자료의 연중 변동성이 강했던 것과 달리, 표본 해상도가 낮아져 매우 매끄러운 선입니다.

R로 시계열 데이터 다루기

apply-dot 함수들

daily_total <-
  apply.daily(hourly_sales,
              FUN = sum)
weekly_max <-
  apply.weekly(daily_temperature,
               FUN = max)
monthly_average <-
  apply.monthly(daily_price,
               FUN = mean)
apply.quarterly(sales_report,
                FUN = sum)
apply.yearly(monthly_salary,
             FUN = sum)
R로 시계열 데이터 다루기

Endpoints와 period.apply

xts::endpoints()

xts::period.apply()

biweekly_eps <-
  endpoints(x = daily_data,
            on = "weeks",
            k = 2)
biweekly_data <-
  period.apply(x = daily_data,
               INDEX = biweekly_eps,
               FUN = mean)
biweekly_data
2002-05-05 8.148611
2002-05-19 8.146776
2002-06-02 8.060020
2002-06-16 8.028224
2002-06-30 7.944792
2002-07-14 7.930159
...
R로 시계열 데이터 다루기

연습해 봅시다!

R로 시계열 데이터 다루기

Preparing Video For Download...