Vecteurs de mots et spaCy

Traitement du langage naturel avec spaCy

Azadeh Mobasher

Principal Data Scientist

Visualisation des vecteurs de mots

  • Les vecteurs de mots aident à comprendre comment les mots sont regroupés

 

Exemple de vecteur de mot

  • L'analyse en composantes principales projette les vecteurs de mots dans un espace bidimensionnel

 

Visualiser les vecteurs de mots

Traitement du langage naturel avec spaCy

Visualisation des vecteurs de mots

  • Importez les bibliothèques requises et un modèle spaCy.
import matplotlib.pyplot as plt
from sklearn.decomposition import PCA
import numpy as np

nlp = spacy.load("en_core_web_md")
  • Extrayez les vecteurs de mots pour une liste donnée et empilez-les verticalement.
words = ["wonderful", "horrible", 
           "apple", "banana", "orange", "watermelon", 
           "dog", "cat"]
word_vectors = np.vstack([nlp.vocab.vectors[nlp.vocab.strings[w]] for w in words])
Traitement du langage naturel avec spaCy

Visualisations des vecteurs de mots

  • Extrayez deux composantes principales avec l'ACP.
pca = PCA(n_components=2)
word_vectors_transformed = pca.fit_transform(word_vectors)

 

  • Visualisez le nuage de points des vecteurs transformés.
plt.figure(figsize=(10, 8))
plt.scatter(word_vectors_transformed[:, 0], word_vectors_transformed[:, 1])

for word, coord in zip(words, word_vectors_transformed): x, y = coord plt.text(x, y, word, size=10) plt.show()
Traitement du langage naturel avec spaCy

Analogies et opérations vectorielles

  • Une relation sémantique entre une paire de mots.
  • Les représentations de mots génèrent des analogies comme le genre et le temps :
    • queen - woman + man = king

Analogies et opérations vectorielles

Traitement du langage naturel avec spaCy

Mots similaires dans un vocabulaire

  • spaCy trouve des termes sémantiquement similaires à un terme donné
import numpy as np
import spacy
nlp = spacy.load("en_core_web_md")

word = "covid"

most_similar_words = nlp.vocab.vectors.most_similar( np.asarray([nlp.vocab.vectors[nlp.vocab.strings[word]]]), n=5) words = [nlp.vocab.strings[w] for w in most_similar_words[0][0]] print(words)
>>> ['Covi', 'CoVid', 'Covici', 'COVID-19', 'corona']
Traitement du langage naturel avec spaCy

Passons à la pratique !

Traitement du langage naturel avec spaCy

Preparing Video For Download...