Auto Models i Tokenizery

Praca z Hugging Face

Jacob H. Marquez

Lead Data Engineer

Potoki: szybko i prosto

from transformers import pipeline  

my_pipeline = pipeline(
    "text-classification",
    model="distilbert-base-uncased-finetuned-sst-2-english"))

print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Praca z Hugging Face

Klasy Auto: elastyczne i wydajne

$$

  • Klasy Auto: elastyczny dostęp do modeli i tokenizerów
  • Większa kontrola nad zachowaniem i wynikami modelu
  • Idealne do zaawansowanych zadań

$$

  • Potoki = szybkość; klasy Auto = elastyczność

Trzy suwaki z przełącznikami i dłoń regulująca jeden z nich. Symbol większej kontroli.

Praca z Hugging Face

AutoModels

  • Wybierz klasę AutoModel, aby bezpośrednio pobrać model

$$

from transformers import AutoModelForSequenceClassification

# Download a pre-trained text classification model model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Praca z Hugging Face

AutoTokenizers

  • Przygotowuje dane tekstowe
  • Zalecane użycie tokenizera sparowanego z modelem

$$

from transformers import AutoTokenizer


# Retrieve the tokenizer paired with the model tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Praca z Hugging Face

Tokenizacja tekstu z AutoTokenizer

  • Tokenizery czyszczą dane wejściowe i dzielą tekst na tokeny

$$

tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")

# Tokenize input text tokens = tokenizer.tokenize("AI: Helping robots think and humans overthink:)") print(tokens)
['ai', ':', 'helping', 'robots', 'think', 'and', 
 'humans', 'over', '##thi', '##nk', ':', ')']
Praca z Hugging Face

Różne modele, różne tokenizery

  • Nasz model (distilbert-base-uncased):

    ['ai', ':', 'helping', 'robots', 'think', 'and', 'humans', 'over', '##thi',
    '##nk', ':', ')']
    
  • Tokenizer BERT-Base-Cased:

    ['AI', ':', 'Help', '##ing', 'robots', 'think', 'and', 'humans', 'over',
    '##thin', '##k', ':', ')']
    
Praca z Hugging Face

Budowanie potoku z klasami Auto

from transformers import AutoModelForSequenceClassification,
AutoTokenizer, pipeline

# Download the model and tokenizer my_model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english") my_tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english")
# Create the custom pipeline my_pipeline = pipeline( task="sentiment-analysis", model=my_model, tokenizer=my_tokenizer)
Praca z Hugging Face

Zastosowania AutoModels i AutoTokenizers

$$

  • 🔧 Stosuj, gdy potrzeba większej kontroli i personalizacji

  • 📝 Przetwarzanie wstępne tekstu: Czyszczenie i tokenizacja dla konkretnych przypadków

  • 🏆 Progowanie: Priorytetyzacja kluczowych kategorii w klasyfikacji
  • 🚀 Złożone przepływy pracy: Kontrola przetwarzania wieloetapowego i integracji

$$ Większa kontrola i personalizacja

Praca z Hugging Face

Czas na ćwiczenia!

Praca z Hugging Face

Preparing Video For Download...