Auto Models och tokenizers

Arbeta med Hugging Face

Jacob H. Marquez

Lead Data Engineer

Pipelines: snabba och enkla

from transformers import pipeline  

my_pipeline = pipeline(
    "text-classification",
    model="distilbert-base-uncased-finetuned-sst-2-english"))

print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Arbeta med Hugging Face

Auto-klasser: flexibla och kraftfulla

$$

  • Auto-klasser: Flexibel åtkomst till modeller och tokenizers
  • Mer kontroll över modellbeteende och utdata
  • Perfekt för avancerade uppgifter

$$

  • Pipelines = snabba; Auto-klasser = flexibla

Tre skjutreglage med handtag och en hand som justerar ett av dem. Representerar mer kontroll.

Arbeta med Hugging Face

AutoModels

  • Välj en AutoModel-klass för att ladda ned en modell direkt

$$

from transformers import AutoModelForSequenceClassification

# Download a pre-trained text classification model model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Arbeta med Hugging Face

AutoTokenizers

  • Förbereder textindata
  • Rekommenderas att använda tokenizern kopplad till modellen

$$

from transformers import AutoTokenizer


# Retrieve the tokenizer paired with the model tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Arbeta med Hugging Face

Tokenisera text med AutoTokenizer

  • Tokenizers rensar indata och delar upp text i tokens

$$

tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")

# Tokenize input text tokens = tokenizer.tokenize("AI: Helping robots think and humans overthink:)") print(tokens)
['ai', ':', 'helping', 'robots', 'think', 'and', 
 'humans', 'over', '##thi', '##nk', ':', ')']
Arbeta med Hugging Face

Olika modeller, olika tokenizers

  • Vår modell (distilbert-base-uncased):

    ['ai', ':', 'helping', 'robots', 'think', 'and', 'humans', 'over', '##thi',
    '##nk', ':', ')']
    
  • BERT-Base-Cased Tokenizer:

    ['AI', ':', 'Help', '##ing', 'robots', 'think', 'and', 'humans', 'over',
    '##thin', '##k', ':', ')']
    
Arbeta med Hugging Face

Bygga en pipeline med Auto-klasser

from transformers import AutoModelForSequenceClassification,
AutoTokenizer, pipeline

# Download the model and tokenizer my_model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english") my_tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english")
# Create the custom pipeline my_pipeline = pipeline( task="sentiment-analysis", model=my_model, tokenizer=my_tokenizer)
Arbeta med Hugging Face

Användningsfall för AutoModels och AutoTokenizers

$$

  • 🔧 Använd för mer kontroll och anpassning

  • 📝 Textförbehandling: Rensa och tokenisera för specifika användningsfall

  • 🏆 Tröskling: Prioritera nyckelkategorier i klassificeringsuppgifter
  • 🚀 Komplexa arbetsflöden: Styr flerstegsbearbetning och integrering

$$ Mer kontroll och anpassning

Arbeta med Hugging Face

Nu kör vi en övning!

Arbeta med Hugging Face

Preparing Video For Download...