Nieuwigheidsdetectie

Machine Learning-workflows ontwerpen in Python

Dr. Chris Anagnostopoulos

Honorary Associate Professor

One-class-classificatie

Trainingsdata zonder anomalieën:

Twee clusters met zwarte punten.

Toekomst-/testdata met anomalieën:

Twee clusters met zwarte punten en ook enkele geïsoleerde punten.

Machine Learning-workflows ontwerpen in Python

Novelty LoF

Workaround

preds = lof().fit_predict(
   np.concatenate([X_train, X_test]))

preds = preds[X_train.shape[0]:]

Twee clusters met zwarte punten en enkele geïsoleerde rode punten.

Novelty LoF

clf = lof(novelty=True)

clf.fit(X_train) y_pred = clf.predict(X_test)

Twee clusters met zwarte punten en enkele geïsoleerde rode punten.

Machine Learning-workflows ontwerpen in Python

One-class Support Vector Machine

clf = OneClassSVM()

clf.fit(X_train) y_pred = clf.predict(X_test)
y_pred[:4]
array([ 1,  1,  1, -1])

Twee clusters met punten en enkele geïsoleerde punten. De meeste punten zijn rood, zowel binnen de clusters als de geïsoleerde punten.

Machine Learning-workflows ontwerpen in Python

One-class Support Vector Machine

clf = OneClassSVM()
clf.fit(X_train)
y_scores = clf.score_samples(X_test)

threshold = np.quantile(y_scores, 0.1)
y_pred = y_scores <= threshold

Twee clusters met zwarte punten en enkele geïsoleerde rode punten.

Machine Learning-workflows ontwerpen in Python

Isolation Forests

clf = IsolationForest()
clf.fit(X_train)
y_scores = clf.score_samples(X_test)
clf = LocalOutlierFactor(novelty=True)
clf.fit(X_train)
y_scores = clf.score_samples(X_test)

Twee clusters met zwarte punten en enkele geïsoleerde rode punten.

Machine Learning-workflows ontwerpen in Python
clf_lof = LocalOutlierFactor(novelty=True).fit(X_train)
clf_isf = IsolationForest().fit(X_train)
clf_svm = OneClassSVM().fit(X_train)
roc_auc_score(y_test, clf_lof.score_samples(X_test)
0.9897
roc_auc_score(y_test, clf_isf.score_samples(X_test))
0.9692
roc_auc_score(y_test, clf_svm.score_samples(X_test))
0.9948
Machine Learning-workflows ontwerpen in Python
clf_lof = LocalOutlierFactor(novelty=True).fit(X_train)
clf_isf = IsolationForest().fit(X_train)
clf_svm = OneClassSVM().fit(X_train)
accuracy_score(y_test, clf_lof.predict(X_test))
0.9318
accuracy_score(y_test, clf_isf.predict(X_test))
0.9545
accuracy_score(y_test, clf_svm.predict(X_test))
0.5
Machine Learning-workflows ontwerpen in Python

Wat is nieuw?

Machine Learning-workflows ontwerpen in Python

Preparing Video For Download...