Úvod do zpracování přirozeného jazyka

Zpracování přirozeného jazyka (NLP) v Pythonu

Fouad Trad

Machine Learning Engineer

Představení instruktora...

 

Fotografie instruktora.

 

Fouad Trad

  • Inženýr strojového učení
  • Výzkumný vědec
  • NLP v kybernetické bezpečnosti a zdravotnictví
Zpracování přirozeného jazyka (NLP) v Pythonu

Co je NLP?

 

 

  • Jazyk je naším hlavním prostředkem komunikace
  • Počítače našemu jazyku nerozumí

Obrázek znázorňující výskyt jazyka: knihy, webové stránky, příspěvky na sociálních sítích a e-maily.

Zpracování přirozeného jazyka (NLP) v Pythonu

Co je NLP?

Umožňuje počítačům analyzovat lidský jazyk

Obrázek osoby hovořící se strojem – NLP překládá to, co osoba říká, aby tomu stroj porozuměl.

Zpracování přirozeného jazyka (NLP) v Pythonu

Pracovní postup NLP

První krok pracovního postupu: surový text.

  • Surový text: od tweetu po odstavec knihy
Zpracování přirozeného jazyka (NLP) v Pythonu

Pracovní postup NLP

Druhý krok pracovního postupu: předzpracování

  • Surový text: od tweetu po odstavec knihy
  • Předzpracování: čištění textu a odstraňování zbytečných prvků
Zpracování přirozeného jazyka (NLP) v Pythonu

Pracovní postup NLP

Třetí krok pracovního postupu: extrakce příznaků.

  • Surový text: od tweetu po odstavec knihy
  • Předzpracování: čištění textu a odstraňování zbytečných prvků
  • Extrakce příznaků: převod textu na čísla
Zpracování přirozeného jazyka (NLP) v Pythonu

Pracovní postup NLP

Čtvrtý krok pracovního postupu: modelování

  • Surový text: od tweetu po odstavec knihy
  • Předzpracování: čištění textu a odstraňování zbytečných prvků
  • Extrakce příznaků: převod textu na čísla
  • Model: analýza, predikce, klasifikace, generování obsahu
Zpracování přirozeného jazyka (NLP) v Pythonu

Plán kurzu

Diagram celého pracovního postupu – kapitola 1 se zaměřuje na předzpracování s NLTK

Zpracování přirozeného jazyka (NLP) v Pythonu

Plán kurzu

Diagram celého pracovního postupu – kapitola 2 se zaměřuje na extrakci příznaků pomocí scikit-learn a Gensim.

Zpracování přirozeného jazyka (NLP) v Pythonu

Plán kurzu

Diagram celého pracovního postupu – kapitoly 3 a 4 pokrývají pipeline skrývající tři kroky: předzpracování, extrakci příznaků a modelování pomocí knihovny transformers.

Zpracování přirozeného jazyka (NLP) v Pythonu

Tokenizace

  • Rozděluje text na tokeny (menší, snadno zpracovatelné části)

Obrázek osoby krájející mrkev

Zpracování přirozeného jazyka (NLP) v Pythonu

Tokenizace vět

  • Text → věty
  • Poskytuje jasnější poznatky než analýza celého textu
import nltk

nltk.download('punkt_tab')
text = "NLP is fun. Let's dive into it!"
sentences = nltk.sent_tokenize(text)
print(sentences)
["NLP is fun.", "Let's dive into it!"]

Obrázek ikony představující překlad.

Zpracování přirozeného jazyka (NLP) v Pythonu

Tokenizace slov

  • Text → slova a interpunkce
  • Vhodné pro úlohy vyžadující:
    • Identifikaci klíčových výrazů
    • Počítání frekvence slov
text = "Claim your free prize now!"

words = nltk.word_tokenize(text)
print(words)
['Claim', 'your', 'free', 'prize', 'now', '!']

Obrázek ikony spamového e-mailu.

Zpracování přirozeného jazyka (NLP) v Pythonu

Pojďme si procvičit!

Zpracování přirozeného jazyka (NLP) v Pythonu

Preparing Video For Download...