Các phương pháp phân cụm để phát hiện gian lận

Phát hiện gian lận với Python

Charlotte Werger

Data Scientist

Phân cụm: tìm mẫu trong dữ liệu

Phát hiện gian lận với Python

K-means: dùng khoảng cách tới tâm cụm

Phát hiện gian lận với Python

K-means: dùng khoảng cách tới tâm cụm

Phát hiện gian lận với Python

K-means: dùng khoảng cách tới tâm cụm

Phát hiện gian lận với Python

Phát hiện gian lận với Python

Phát hiện gian lận với Python

Phát hiện gian lận với Python

Phân cụm k-means trong Python

# Import the packages
from sklearn.preprocessing import MinMaxScaler
from sklearn.cluster import KMeans

# Transform and scale your data X = np.array(df).astype(np.float)
scaler = MinMaxScaler() X_scaled = scaler.fit_transform(X)
# Define the k-means model and fit to the data kmeans = KMeans(n_clusters=6, random_state=42).fit(X_scaled)
Phát hiện gian lận với Python

Số cụm phù hợp

Kiểm tra số cụm:

  • Phương pháp silhouette
  • Đường khuỷu tay (elbow)
clust = range(1, 10) 
kmeans = [KMeans(n_clusters=i) for i in clust]

score = [kmeans[i].fit(X_scaled).score(X_scaled) for i in range(len(kmeans))]
plt.plot(clust,score) plt.xlabel('Number of Clusters') plt.ylabel('Score') plt.title('Elbow Curve') plt.show()
Phát hiện gian lận với Python

Đường khuỷu tay (elbow)

Phát hiện gian lận với Python

Hãy thực hành!

Phát hiện gian lận với Python

Preparing Video For Download...