PyTorch로 배우는 텍스트 딥러닝
Shubham Jain
Data Scientist
활용 사례:

선수 과정: Intermediate Deep Learning with PyTorch


![]()

torchtext로 토큰화from torchtext.data.utils import get_tokenizertokenizer = get_tokenizer("basic_english")tokens = tokenizer("I am reading a book now. I love to read books!") print(tokens)
["I", "am", "reading", "a", "book", "now", ".", "I", "love", "to", "read",
"books", "!"]
import nltk nltk.download('stopwords') from nltk.corpus import stopwordsstop_words = set(stopwords.words('english'))tokens = ["I", "am", "reading", "a", "book", "now", ".", "I", "love", "to", "read", "books", "!"] filtered_tokens = [token for token in tokens if token.lower() not in stop_words]print(filtered_tokens)
["reading", "book", ".", "love", "read", "books", "!"]
import nltk from nltk.stem import PorterStemmerstemmer = PorterStemmer()filtered_tokens = ["reading", "book", ".", "love", "read", "books", "!"]stemmed_tokens = [stemmer.stem(token) for token in filtered_tokens]print(stemmed_tokens)
["read", "book", ".", "love", "read", "book", "!"]
from nltk.probability import FreqDist stemmed_tokens= ["read", "book", ".", "love", "read", "book", "!"] freq_dist = FreqDist(stemmed_tokens)threshold = 2common_tokens = [token for token in stemmed_tokens if freq_dist[token] > threshold] print(common_tokens)
["read", "book", "read", "book"]
토큰화, 불용어 제거, 어간 추출, 희귀 단어 제거
PyTorch로 배우는 텍스트 딥러닝