기술 통계로 데이터 요약하기

Python으로 금융 데이터 가져오기와 관리

Stefan Jansen

Instructor

데이터를 파악하세요

  • 목표: 핵심 정량 특성 파악
  • 확인할 관점:
    • 중심 경향: 어떤 값이 “대표적”인가?
    • 산포도: 이상치가 있는가?
    • 단일 변수의 전체 분포
Python으로 금융 데이터 가져오기와 관리

중심 경향

  • 평균(산술평균): $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 중앙값: 값의 50%가 더 작고/큼
  • 최빈값: 가장 자주 나타나는 값

대칭 분포

Python으로 금융 데이터 가져오기와 관리

중심 경향

  • 평균(산술평균): $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 중앙값: 값의 50%가 더 작고/큼
  • 최빈값: 가장 자주 나타나는 값

왜도 있는 분포

Python으로 금융 데이터 가져오기와 관리

중심 경향

  • 평균(산술평균): $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 중앙값: 값의 50%가 더 작고/큼
  • 최빈값: 가장 자주 나타나는 값

이봉 분포

Python으로 금융 데이터 가져오기와 관리

요약 통계 계산하기

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', na_values='n/a')
market_cap = nasdaq['Market Capitalization'].div(10**6)
market_cap.mean()
3180.7126214953805
market_cap.median()
225.9684285
market_cap.mode()
0.0
Python으로 금융 데이터 가져오기와 관리

요약 통계 계산하기

시가총액 히스토그램

Python으로 금융 데이터 가져오기와 관리

산포도

  • 분산: 평균으로부터의 제곱편차 합을 $n-1$로 나눔
    • $\displaystyle var = \frac{1}{n-1}\sum_{i=1}^n(x_i-\bar{x})^2$
  • 표준편차: 분산의 제곱근
    • $\displaystyle sd = \sqrt{var}$

시가총액 분산 시각화

Python으로 금융 데이터 가져오기와 관리

분산과 표준편차 계산

variance = market_cap.var()
print(variance)
648773812.8182
np.sqrt(variance)
25471.0387
market_cap.std()
25471.0387
Python으로 금융 데이터 가져오기와 관리

연습해 봅시다!

Python으로 금융 데이터 가져오기와 관리

Preparing Video For Download...