単語ベクトルとspaCy

spaCyで学ぶNatural Language Processing

Azadeh Mobasher

Principal Data Scientist

単語ベクトルの可視化

  • 単語ベクトルで単語のグループ化を把握

 

単語ベクトルの例

  • 主成分分析(PCA)で単語ベクトルを2次元に射影

 

単語ベクトルの可視化

spaCyで学ぶNatural Language Processing

単語ベクトルの可視化

  • 必要なライブラリとspaCyモデルをインポート
import matplotlib.pyplot as plt
from sklearn.decomposition import PCA
import numpy as np

nlp = spacy.load("en_core_web_md")
  • 指定した単語リストのベクトルを取得し縦に結合
words = ["wonderful", "horrible", 
           "apple", "banana", "orange", "watermelon", 
           "dog", "cat"]
word_vectors = np.vstack([nlp.vocab.vectors[nlp.vocab.strings[w]] for w in words])
spaCyで学ぶNatural Language Processing

単語ベクトルの可視化例

  • PCAで第1・第2主成分を抽出
pca = PCA(n_components=2)
word_vectors_transformed = pca.fit_transform(word_vectors)

 

  • 変換後ベクトルの散布図を描画
plt.figure(figsize=(10, 8))
plt.scatter(word_vectors_transformed[:, 0], word_vectors_transformed[:, 1])

for word, coord in zip(words, word_vectors_transformed): x, y = coord plt.text(x, y, word, size=10) plt.show()
spaCyで学ぶNatural Language Processing

アナロジーとベクトル演算

  • 単語対の意味的関係
  • 単語埋め込みは性別や時制などのアナロジーを生成:
    • queen - woman + man = king

アナロジーとベクトル演算

spaCyで学ぶNatural Language Processing

語彙内の類似語

  • spaCyで指定語に意味的に近い語を検索
import numpy as np
import spacy
nlp = spacy.load("en_core_web_md")

word = "covid"

most_similar_words = nlp.vocab.vectors.most_similar( np.asarray([nlp.vocab.vectors[nlp.vocab.strings[word]]]), n=5) words = [nlp.vocab.strings[w] for w in most_similar_words[0][0]] print(words)
>>> ['Covi', 'CoVid', 'Covici', 'COVID-19', 'corona']
spaCyで学ぶNatural Language Processing

練習しましょう!

spaCyで学ぶNatural Language Processing

Preparing Video For Download...