데이터 이상치와 스케일링

Python으로 연습하는 Machine Learning 면접 질문

Lisa Stuart

Data Scientist

이상치

  • 특정 특성에서 나머지 관측치와 멀리 떨어진 하나 이상의 관측치.

데이터 이상치

1 https://bolt.mph.ufl.edu/6050-6052/unit-1/one-quantitative-variable-introduction/understanding-outliers/
Python으로 연습하는 Machine Learning 면접 질문

사분위 범위(IQR)

데이터 IQR

1 By Jhguch at en.wikipedia, CC BY-SA 2.5, https://commons.wikimedia.org/w/index.php?curid=14524285
Python으로 연습하는 Machine Learning 면접 질문

최적 적합선

선형 모델 적합

1 https://www.r-bloggers.com/outlier-detection-and-treatment-with-r/
Python으로 연습하는 Machine Learning 면접 질문

이상치 처리 함수

Function returns
sns.boxplot(x= , y='Loan Status') 타깃 변수 기준 박스플롯
sns.distplot() 히스토그램과 커널 밀도 추정(kde)
np.abs() 절댓값 반환
stats.zscore() z-점수 계산
mstats.winsorize(limits=[0.05, 0.05]) 이상치에 바닥/천장 적용
np.where(condition, true, false) 값 치환
Python으로 연습하는 Machine Learning 면접 질문

높은 분산 vs 낮은 분산

분산

1 https://machinelearningmastery.com/a-gentle-introduction-to-calculating-normal-summary-statistics/
Python으로 연습하는 Machine Learning 면접 질문

표준화 vs 정규화

  • 표준화:
    • Z-점수 표준화
    • 평균 0, 표준편차 1로 스케일링

z-점수 표준화 공식

  • 정규화:
    • Min/Max 정규화
    • (0, 1) 범위로 스케일링

최소-최대 스케일링 공식

1 https://medium.com/@rrfd/standardize-or-normalize-examples-in-python-e3f174b65dfc
Python으로 연습하는 Machine Learning 면접 질문

스케일링 함수

  • scikit-learn.preprocessing.StandardScaler() --> (mean=0, sd=1)
  • sklearn.preprocessing.MinMaxScaler() --> (0,1)
Python으로 연습하는 Machine Learning 면접 질문

이상치와 스케일링

이상치는 어떻게 식별·처리해야 할까요? Min/Max 또는 Z-점수 표준화는 데이터에 어떤 영향을 줄까요? 옳은 문장을 고르세요:

  • 이상치는 해당 특성에서 유사한 점들의 범위를 약간 벗어난 점이다.
  • 특정 맥락에서 이상(비정상)으로 간주되는 이상치는 예측 ML 모델 구축에 도움이 된다.
  • Min/Max 스케일링은 평균 0, 표준편차 1을 만들고 분산을 증가시킨다.
  • Z-점수 표준화는 데이터를 (0,1)로 스케일링하고 적합도를 개선한다.
Python으로 연습하는 Machine Learning 면접 질문

이상치와 스케일링: 정답

이상치는 어떻게 식별·처리해야 할까요? Min/Max 또는 Z-점수 표준화는 데이터에 어떤 영향을 줄까요? 정답:

  • 특정 맥락에서 이상(비정상)으로 간주되는 이상치는 예측 ML 모델 구축에 도움이 된다. (사기 탐지, 보안 이벤트 등에서는 이상을 찾는 것이 목표다.)
Python으로 연습하는 Machine Learning 면접 질문

이상치와 스케일링: 오답 해설

이상치는 어떻게 식별·처리해야 할까요? Min/Max 또는 Z-점수 표준화는 데이터에 어떤 영향을 줄까요?

  • 이상치는 유사한 점들의 범위를 약간 벗어난 것이다. (의심은 IQR의 1.5배 이상 벗어날 때 시작된다.)
  • Min/Max 스케일링은 평균 0, 표준편차 1을 만들고 분산을 증가시킨다. (Min/Max는 값을 (0,1)로 스케일링하며 분산 증감은 원자료에 따라 다르다.)
  • Z-점수 표준화는 데이터를 (0,1)로 스케일링하고 적합도를 개선한다. (Z-점수 표준화는 평균 0, 표준편차 1로 만들며, 모델 적합을 개선할 수 있다.)
Python으로 연습하는 Machine Learning 면접 질문

마지막으로...

전처리 단계

Python으로 연습하는 Machine Learning 면접 질문

연습해 봅시다!

Python으로 연습하는 Machine Learning 면접 질문

Preparing Video For Download...