Học có giám sát với scikit-learn
George Boorman
Core Curriculum Manager, DataCamp
Đo hiệu suất bằng độ chính xác:
Tỷ lệ mẫu được phân loại đúng
Không phải lúc nào cũng hữu ích
Phân loại để dự đoán giao dịch ngân hàng gian lận
Có thể tạo bộ phân loại dự đoán KHÔNG giao dịch nào là gian lận
Chính xác 99%!
Nhưng dự đoán giao dịch gian lận rất kém
Không đạt mục tiêu ban đầu
Mất cân bằng lớp: Tần suất lớp không đều
Cần cách đánh giá khác














from sklearn.metrics import classification_report, confusion_matrixknn = KNeighborsClassifier(n_neighbors=7)X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.4, random_state=42)knn.fit(X_train, y_train)y_pred = knn.predict(X_test)
print(confusion_matrix(y_test, y_pred))
[[1106 11]
[ 183 34]]
print(classification_report(y_test, y_pred))
precision recall f1-score support
0 0.86 0.99 0.92 1117
1 0.76 0.16 0.26 217
accuracy 0.85 1334
macro avg 0.81 0.57 0.59 1334
weighted avg 0.84 0.85 0.81 1334
Học có giám sát với scikit-learn