Deep Learning para texto con PyTorch
Shubham Jain
Data Scientist
"- Clasificación de texto
"Casos de uso:
{{7}}"
"Curso previo: Aprendizaje profundo intermedio con PyTorch


"
"
"
"- Tokenización
"- Se extraen tokens o palabras del texto
torchtextfrom torchtext.data.utils import get_tokenizertokenizer = get_tokenizer(\"basic_english\")tokens = tokenizer(\"I am reading a book now. ¡Me encanta leer libros!\") print(tokens)
out
[\"I\", \"am\", \"reading\", \"a\", \"book\", \"now\", \".\", \"I\", \"love\", \"to\", \"read\",
\"books\", \"!\"]{{5}}"
"- Elimina palabras comunes que no aportan significado
import nltk nltk.download('stopwords') from nltk.corpus import stopwordsstop_words = set(stopwords.words('english'))tokens = [\"I\", \"am\", \"reading\", \"a\", \"book\", \"now\", \".\", \"I\", \"love\", \"to\", \"read\", \"books\", \"!\"] filtered_tokens = [token for token in tokens if token.lower() not in stop_words]print(filtered_tokens)
out
[\"reading\", \"book\", \".\", \"love\", \"read\", \"books\", \"!\"]{{5}}"
"- Reducir las palabras a su forma base
import nltk from nltk.stem import PorterStemmerstemmer = PorterStemmer()filtered_tokens = [\"reading\", \"book\", \".\", \"love\", \"read\", \"books\", \"!\"]stemmed_tokens = [stemmer.stem(token) for token in filtered_tokens]print(stemmed_tokens)
out
[\"read\", \"book\", \".\", \"love\", \"read\", \"book\", \"!\"]{{7}}"
"- Eliminando palabras poco frecuentes que no aportan valor
from nltk.probability import FreqDist stemmed_tokens= [\"read\", \"book\", \".\", \"love\", \"read\", \"book\", \"!\"] freq_dist = FreqDist(stemmed_tokens)threshold = 2common_tokens = [token for token in stemmed_tokens if freq_dist[token] > threshold] print(common_tokens)
out
[\"read\", \"book\", \"read\", \"book\"]{{5}}"
Tokenización, eliminación de palabras vacías, stemming y eliminación de palabras poco frecuentes
Deep Learning para texto con PyTorch