Úvod do jazykových modelů

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

David Cecchini

Data Scientist

Pravděpodobnost věty

Mnoho dostupných modelů

  • Pravděpodobnost věty „I loved this movie".
  • Unigramový model
    • $$P(\text{sentence}) = P(\text{I})P(\text{loved})P(\text{this})P(\text{movie})$$
  • N-gramový model
    • N = 2 (bigram): $$P(\text{sentence}) = P(\text{I})P(\text{loved} | \text{I})P(\text{this} | \text{loved})P(\text{movie} | \text{this})$$
    • N = 3 (trigram): $$P(\text{sentence}) = P(\text{I})P(\text{loved} | \text{I})P(\text{this} | \text{I loved})P(\text{movie} | \text{loved this})$$
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Pravděpodobnost věty (pokračování)

  • Skip-gram
    • $$P(\text{sentence}) = P(\text{context of I} | \text{I})P(\text{context of loved} | \text{loved}) \ $$ $$P(\text{context of this} | \text{this})P(\text{context of movie} | \text{movie})$$
  • Neuronové sítě
    • Pravděpodobnost věty je dána funkcí softmax na výstupní vrstvě sítě
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Propojení s RNN

Jazykové modely jsou všude v RNN!

  • Samotná síť

Modely RNN lze chápat jako jazykové modely, protože je lze použít k předpovídání dalšího slova.

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Propojení s RNN (pokračování)

  • Vrstva embeddingů

Zobrazuje makro reprezentaci vrstev modelu. Vrstva embeddingů musí být první vrstvou za vstupní vrstvou a vytváří hustou reprezentaci slov.

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Vytváření slovníkových slovníků

# Get unique words
unique_words = list(set(text.split(' ')))
# Create dictionary: word is key, index is value
word_to_index = {k:v for (v,k) in enumerate(unique_words)}
# Create dictionary: index is key, word is value
index_to_word = {k:v for (k,v) in enumerate(unique_words)}
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Předzpracování vstupu

# Initialize variables X and y
X = []
y = []

# Loop over the text: length `sentence_size` per time with step equal to `step` for i in range(0, len(text) - sentence_size, step):
X.append(text[i:i + sentence_size]) y.append(text[i + sentence_size])
# Example (numbers are numerical indexes of vocabulary):
# Sentence is: "i loved this movie" -> (["i", "loved", "this"], "movie")
X[0],y[0] = ([10, 444, 11], 17)
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Transformace nových textů

# Create list to keep the sentences of indexes
new_text_split = []

# Loop and get the indexes from dictionary for sentence in new_text:
sent_split = []
for wd in sentence.split(' '):
ix = wd_to_index[wd]
sent_split.append(ix)
new_text_split.append(sent_split)
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Pojďme si procvičit!

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Preparing Video For Download...