비정형 데이터

Python으로 설계하는 Machine Learning 워크플로

Dr. Chris Anagnostopoulos

Honorary Associate Professor

정형 vs 비정형

  Class   AGE  SEX  STEROID    ...        
0    2.0  50.0  2.0      1.0    ...      
1    2.0  40.0  1.0      1.0    ...       
...
           label                                           sequence
0          VIRUS  AVTVVPDPTCCGTLSFKVPKDAKKGKHLGTFDIRQAIMDYGGLHSQ...
1  IMMUNE SYSTEM  QVQLQQPGAELVKPGASVKLSCKASGYTFTSYWMHWVKQRPGRGLE...
2  IMMUNE SYSTEM  QAVVTQESALTTSPGETVTLTCRSSTGAVTTSNYANWVQEKPDHLF...
3          VIRUS  MSQVTEQSVRFQTALASIKLIQASAVLDLTEDDFDFLTSNKVWIAT...
...

이 데이터에서 바이러스를 이상치로 표시하는 탐지기를 만들 수 있을까요?

Python으로 설계하는 Machine Learning 워크플로
import stringdist
stringdist.levenshtein('abc', 'acc')
1
stringdist.levenshtein('acc', 'cce')
2
             label   sequence
169  IMMUNE SYSTEM  ILSALVGIV
170  IMMUNE SYSTEM  ILSALVGIL
stringdist.levenshtein('ILSALVGIV', 'ILSALVGIL')
1
Python으로 설계하는 Machine Learning 워크플로

디버깅 몇 가지

# 이렇게는 작동하지 않음
pdist(proteins['sequence'].iloc[:3], metric=stringdist.levenshtein)
Traceback (most recent call last):
ValueError: A 2-dimensional array must be passed.
Python으로 설계하는 Machine Learning 워크플로

디버깅 몇 가지

sequences = np.array(proteins['sequence'].iloc[:3]).reshape(-1,1)

# 다른 이유로도 작동하지 않음 pdist(sequences, metric=stringdist.levenshtein)
Traceback (most recent call last):
TypeError: argument 1 must be str, not numpy.ndarray
Python으로 설계하는 Machine Learning 워크플로

디버깅 몇 가지

# 이건 작동!!
def my_levenshtein(x, y):
    return stringdist.levenshtein(x[0], y[0])

pdist(sequences, metric=my_levenshtein)
array([136.,   2., 136.])
Python으로 설계하는 Machine Learning 워크플로

사전 계산 행렬로 단백질 이상치 탐지

# 약 1000개 예시에 2분 소요
M = pdist(sequences, my_levenshtein)

사전 계산 거리 행렬을 이용한 LoF 탐지기:

# 3초 소요
detector = lof(metric='precomputed', contamination=0.1)
preds = detector.fit_predict(M)
roc_auc_score(proteins['label'] == 'VIRUS', preds == -1)
0.64
Python으로 설계하는 Machine Learning 워크플로

거리 선택하기

Python으로 설계하는 Machine Learning 워크플로

Preparing Video For Download...