Použití předtrénovaných LLM

Úvod do LLMs v Pythonu

Jasmin Ludolf

Senior Data Science Content Developer, DataCamp

Porozumění jazyku

Osoba sedící u stolu s různými úkoly znázorňujícími klasifikaci textu, sumarizaci, analýzu sentimentu a otázky a odpovědi

Úvod do LLMs v Pythonu

Generování jazyka

Osoba sedící u stolu s různými úkoly znázorňujícími generování textu a překlad

Úvod do LLMs v Pythonu

Generování textu

generator = pipeline(task="text-generation", model="distilgpt2")

prompt = "The Gion neighborhood in Kyoto is famous for"

output = generator(prompt, max_length=100, pad_token_id=generator.tokenizer.eos_token_id)
  • Koherentní
  • Smysluplný
  • Přirozený text
  • eos_token_id: ID tokenu konce sekvence
Úvod do LLMs v Pythonu

Generování textu

Ilustrace dvou sekvencí: we should go, i really like to travel. Zobrazuje ID tokenů a místa padding a EOS

  • pad_token_id: doplní místo až do max_length
  • Padding: přidávání tokenů
  • Nastavení na generator.tokenizer.eos_token_id označuje konec smysluplného textu, naučeného při trénování
  • Model generuje až do max_length nebo pad_token_id
  • truncation = True
Úvod do LLMs v Pythonu

Generování textu

generator = pipeline(task="text-generation", model="distilgpt2")

prompt = "The Gion neighborhood in Kyoto is famous for"

output = generator(prompt, max_length=100, pad_token_id=generator.tokenizer.eos_token_id)

print(output[0]["generated_text"])
The Gion neighborhood in Kyoto is famous for its many colorful green forests, such as the 
Red Hill, the Red River and the Red River. The Gion neighborhood is home to the world's 
tallest trees.
  • Výstup může být neoptimální, pokud je výzva vágní
Úvod do LLMs v Pythonu

Řízení výstupu

generator = pipeline(task="text-generation", model="distilgpt2")


review = "This book was great. I enjoyed the plot twist in Chapter 10." response = "Dear reader, thank you for your review." prompt = f"Book review:\n{review}\n\nBook shop response to the review:\n{response}"
output = generator(prompt, max_length=100, pad_token_id=generator.tokenizer.eos_token_id) print(output[0]["generated_text"])
Dear reader, thank you for your review. We'd like to thank you for your reading!
Úvod do LLMs v Pythonu

Překlad jazyka

  • Hugging Face nabízí úplný seznam překladových úloh a modelů
translator = pipeline(task="translation_en_to_es", model="Helsinki-NLP/opus-mt-en-es")

text = "Walking amid Gion's Machiya wooden houses was a mesmerizing experience."
output = translator(text, clean_up_tokenization_spaces=True)
print(output[0]["translation_text"])
Caminar entre las casas de madera Machiya de Gion fue una experiencia fascinante.
Úvod do LLMs v Pythonu

Pojďme procvičovat!

Úvod do LLMs v Pythonu

Preparing Video For Download...