テキストデータの活用

Pythonで学ぶ不正検知

Charlotte Werger

Data Scientist

不正検知ではテキストデータに頻繁に出会います

有用なテキストデータの例:

  1. 従業員や顧客のメール
  2. 取引の説明
  3. 従業員のメモ
  4. 保険金請求書の記載欄
  5. 通話録音
  6. など
Pythonで学ぶ不正検知

不正検知のためのテキストマイニング手法

  1. 文字列検索
  2. 感情分析
  3. 単語頻度・トピック分析
  4. 文体
Pythonで学ぶ不正検知

不正検知のための文字列検索

疑わしい語のフラグ付け:

  1. 単純・明快で説明しやすい
  2. 機械学習モデルの上位フィルターとして利用可能
  3. 機械学習モデルの特徴量として利用可能

Pythonで学ぶ不正検知

pandasで単語検索して不正をフラグ化

# Using a string operator to find words
df['email_body'].str.contains('money laundering')

# Select data that matches df.loc[df['email_body'].str.contains('money laundering', na=False)]
# Create a list of words to search for list_of_words = ['police', 'money laundering'] df.loc[df['email_body'].str.contains('|'.join(list_of_words) , na=False)]
# Create a fraud flag df['flag'] = np.where((df['email_body'].str.contains('|'.join (list_of_words)) == True), 1, 0)
Pythonで学ぶ不正検知

演習に進みましょう!

Pythonで学ぶ不正検知

Preparing Video For Download...