Asignar fraude vs. no fraude

Fraud Detection in Python

Charlotte Werger

Data Scientist

Empezar con datos agrupados

Fraud Detection in Python

Asignar los centroides de los clústeres

Fraud Detection in Python

Definir distancias al centroide del clúster

Fraud Detection in Python

Marcar fraude para los más alejados del centroide

Fraud Detection in Python

Marcar fraude según la distancia al centroide

# Run the kmeans model on scaled data
kmeans = KMeans(n_clusters=6, random_state=42).fit(X_scaled)

# Get the cluster number for each datapoint X_clusters = kmeans.predict(X_scaled)
# Save the cluster centroids X_clusters_centers = kmeans.cluster_centers_
# Calculate the distance to the cluster centroid for each point dist = [np.linalg.norm(x-y) for x,y in zip(X_scaled, X_clusters_centers[X_clusters])]
# Create predictions based on distance km_y_pred = np.array(dist) km_y_pred[dist>=np.percentile(dist, 93)] = 1 km_y_pred[dist<np.percentile(dist, 93)] = 0
Fraud Detection in Python

Validar los resultados del modelo

  • Consulta con la persona analista de fraude
  • Investiga y describe mejor los casos marcados
  • Compara con casos históricos de fraude
Fraud Detection in Python

¡Vamos a practicar!

Fraud Detection in Python

Preparing Video For Download...