टॉपिक्स के आधार पर धोखाधड़ी फ़्लैग करना

Python में Fraud Detection

Charlotte Werger

Data Scientist

धोखाधड़ी पहचान के लिए LDA मॉडल के नतीजों का उपयोग

  1. क्या कोई संदिग्ध टॉपिक्स हैं? (no labels)
  2. धोखाधड़ी और गैर-धोखाधड़ी मामलों में टॉपिक्स समान हैं? (with labels)
  3. क्या कुछ टॉपिक्स से धोखाधड़ी मामलों का अधिक संबंध है? (with labels)
Python में Fraud Detection

टॉपिक्स समझने के लिए विज़ुअलाइज़ करना जरूरी है

import pyLDAvis.gensim
lda_display = pyLDAvis.gensim.prepare(ldamodel, corpus, 
                         dictionary, sort_topics=False)
pyLDAvis.display(lda_display)
Python में Fraud Detection

टॉपिक्स में अंतर कैसे है, जाँचें

Python में Fraud Detection

मूल डेटा में टॉपिक्स असाइन करें

def get_topic_details(ldamodel, corpus):
    topic_details_df = pd.DataFrame()
    for i, row in enumerate(ldamodel[corpus]):
        row = sorted(row, key=lambda x: (x[1]), reverse=True)
        for j, (topic_num, prop_topic) in enumerate(row):
            if j == 0:  # => dominant topic
                wp = ldamodel.show_topic(topic_num)
                topic_details_df = topic_details_df.append(pd.Series([topic_num, prop_topic]), 
                                                                      ignore_index=True)
    topic_details_df.columns = ['Dominant_Topic', '% Score']
    return topic_details_df
Python में Fraud Detection

मूल डेटा में टॉपिक्स असाइन करें

contents = pd.DataFrame({'Original text':text_clean})
topic_details = pd.concat([get_topic_details(ldamodel,
                           corpus), contents], axis=1)
topic_details.head()
    Dominant_Topic    % Score     Original text
0    0.0              0.989108    [investools, advisory, free, ...
1    0.0              0.993513    [forwarded, richard, b, ...
2    1.0              0.964858    [hey, wearing, target, purple, ...
3    0.0              0.989241    [leslie, milosevich, santa, clara, ...
Python में Fraud Detection

अभ्यास करते हैं!

Python में Fraud Detection

Preparing Video For Download...