Natural Language Processing (NLP) en Python
Fouad Trad
Machine Learning Engineer

Comprendre le sujet d'un texte

Comprendre le sujet d'un texte

Les tâches où chaque mot compte dans le texte

NLTK fournit une liste de stop words pour plusieurs langues
from nltk.corpus import stopwords nltk.download('stopwords')stop_words = stopwords.words('english')print(stop_words[:10])
['a', 'about', 'above', 'after', 'again', 'against', 'ain', 'all', 'am', 'an']
from nltk.tokenize import word_tokenizetext = "This is an example to demonstrate removing stop words."tokens = word_tokenize(text)# The .lower() method helps with case sensitivity filtered_tokens = [word for word in tokens if word.lower() not in stop_words]print(filtered_tokens)
['example', 'demonstrate', 'removing', 'stop', 'words', '.']

Trouver des mots fréquents ou importants dans des documents

Trouver des mots fréquents ou importants dans des documents

Les tâches où il faut garder la structure des phrases pour la clarté

import string
print(string.punctuation)
!"#$%&'()*+,-./:;<=>?@[\]^_`{|}~
text = "This is an example to demonstrate removing stop words." tokens = word_tokenize(text) filtered_tokens = [word for word in tokens if word.lower() not in stop_words]clean_tokens = [word for word in filtered_tokens if word not in string.punctuation]print(clean_tokens)
['example', 'demonstrate', 'removing', 'stop', 'words']
Natural Language Processing (NLP) en Python