Attribuer fraude ou non-fraude

Détection de fraude en Python

Charlotte Werger

Data Scientist

Démarrer avec des données groupées

Détection de fraude en Python

Attribuer les centroïdes de groupes

Détection de fraude en Python

Définir les distances au centroïde du groupe

Détection de fraude en Python

Marquer comme fraude les plus éloignées du centroïde

Détection de fraude en Python

Repérer la fraude selon la distance au centroïde

# Run the kmeans model on scaled data
kmeans = KMeans(n_clusters=6, random_state=42).fit(X_scaled)

# Get the cluster number for each datapoint X_clusters = kmeans.predict(X_scaled)
# Save the cluster centroids X_clusters_centers = kmeans.cluster_centers_
# Calculate the distance to the cluster centroid for each point dist = [np.linalg.norm(x-y) for x,y in zip(X_scaled, X_clusters_centers[X_clusters])]
# Create predictions based on distance km_y_pred = np.array(dist) km_y_pred[dist>=np.percentile(dist, 93)] = 1 km_y_pred[dist<np.percentile(dist, 93)] = 0
Détection de fraude en Python

Valider les résultats du modèle

  • Valider avec l'analyste en fraude
  • Examiner et décrire plus en détail les cas signalés
  • Comparer aux cas de fraude connus auparavant
Détection de fraude en Python

Passons à la pratique !

Détection de fraude en Python

Preparing Video For Download...