Keras के साथ Machine Translation
Thushan Ganegedara
Data Scientist and Author
डेटा
en_text : वाक्यों की Python सूची, हर वाक्य स्पेस से अलग किए शब्दों की स्ट्रिंग है।fr_text: वाक्यों की Python सूची, हर वाक्य स्पेस से अलग किए शब्दों की स्ट्रिंग है।डेटासेट से कुछ डेटा प्रिंट करना
for en_sent, fr_sent in zip(en_text[:3], fr_text[:3]):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
English: new jersey is sometimes quiet during autumn , and it is snowy in april .
French: new jersey est parfois calme pendant l' automne , et il est neigeux en avril .
English: the united states is usually chilly during july , and it is usually freezing in november .
French: les états-unis est généralement froid en juillet , et il gèle habituellement en novembre .
...
टोकनाइज़ेशन
"I watched a movie last night, it was okay." बनता है,[I, watched, a, movie, last, night, it, was, okay]Keras के साथ टोकनाइज़ेशन
from tensorflow.keras.preprocessing.text import Tokenizer
en_tok = Tokenizer()
en_tok = Tokenizer()
en_tok.fit_on_texts(en_text)
Tokenizer का word_index एट्रिब्यूट उपयोग करें।id = en_tok.word_index["january"] # => returns 51
w = en_tok.index_word[51] # => returns 'january'
seq = en_tok.texts_to_sequences(['she likes grapefruit , peaches , and lemons .'])
[[26, 70, 27, 73, 7, 74]]
Tokenizer में vocabulary का आकार लिमिट कर सकते हैं।tok = Tokenizer(num_words=50)
आउट-ऑफ-वोकैब्युलरी (OOV) शब्द
उदाहरण:
tok.fit_on_texts(["I drank milk"])tok.texts_to_sequences(["I drank water"])water एक OOV शब्द है और इग्नोर होगा।tok = Tokenizer(num_words=50, oov_token='UNK')
tok.fit_on_texts(["I drank milk"])tok.texts_to_sequences(["I drank water"])water एक OOV शब्द है और UNK से बदला जाएगा।Keras के साथ Machine Translation