Auto modely a tokenizéry

Working with Hugging Face

Jacob H. Marquez

Lead Data Engineer

Pipeline: rychlé a jednoduché

from transformers import pipeline  

my_pipeline = pipeline(
    "text-classification",
    model="distilbert-base-uncased-finetuned-sst-2-english"))

print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Working with Hugging Face

Auto třídy: flexibilní a výkonné

$$

  • Auto třídy: Flexibilní přístup k modelům a tokenizérům
  • Větší kontrola nad chováním modelu a výstupy
  • Vhodné pro pokročilé úlohy

$$

  • Pipeline = rychlost; Auto třídy = flexibilita

Tři posuvníky s přepínači a ruka upravující jeden z nich. Znázornění větší kontroly.

Working with Hugging Face

AutoModely

  • Zvolte třídu AutoModel pro přímé stažení modelu

$$

from transformers import AutoModelForSequenceClassification

# Download a pre-trained text classification model model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Working with Hugging Face

AutoTokenizéry

  • Příprava vstupních textových dat
  • Doporučuje se použít tokenizér spárovaný s modelem

$$

from transformers import AutoTokenizer


# Retrieve the tokenizer paired with the model tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Working with Hugging Face

Tokenizace textu pomocí AutoTokenizer

  • Tokenizéry čistí vstup a rozdělují text na tokeny

$$

tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")

# Tokenize input text tokens = tokenizer.tokenize("AI: Helping robots think and humans overthink:)") print(tokens)
['ai', ':', 'helping', 'robots', 'think', 'and', 
 'humans', 'over', '##thi', '##nk', ':', ')']
Working with Hugging Face

Různé modely, různé tokenizéry

  • Náš model (distilbert-base-uncased):

    ['ai', ':', 'helping', 'robots', 'think', 'and', 'humans', 'over', '##thi',
    '##nk', ':', ')']
    
  • Tokenizér BERT-Base-Cased:

    ['AI', ':', 'Help', '##ing', 'robots', 'think', 'and', 'humans', 'over',
    '##thin', '##k', ':', ')']
    
Working with Hugging Face

Sestavení pipeline pomocí Auto tříd

from transformers import AutoModelForSequenceClassification,
AutoTokenizer, pipeline

# Download the model and tokenizer my_model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english") my_tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english")
# Create the custom pipeline my_pipeline = pipeline( task="sentiment-analysis", model=my_model, tokenizer=my_tokenizer)
Working with Hugging Face

Případy užití AutoModelů a AutoTokenizérů

$$

  • 🔧 Využití pro větší kontrolu a přizpůsobení

  • 📝 Předzpracování textu: Čištění a tokenizace pro konkrétní případy

  • 🏆 Prahování: Prioritizace klíčových kategorií při klasifikaci
  • 🚀 Složité pracovní postupy: Řízení vícefázového zpracování a integrace

$$ Větší kontrola a přizpůsobení

Working with Hugging Face

Pojďme si procvičit!

Working with Hugging Face

Preparing Video For Download...