Авто-моделі та токенізатори

Робота з Hugging Face

Jacob H. Marquez

Lead Data Engineer

Pipelines: швидко й просто

from transformers import pipeline  

my_pipeline = pipeline(
    "text-classification",
    model="distilbert-base-uncased-finetuned-sst-2-english"))

print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Робота з Hugging Face

Auto-класи: гнучкі та потужні

$$

  • Auto-класи: гнучкий доступ до моделей і токенізаторів
  • Більше контролю над поведінкою моделі та виходами
  • Підійдуть для складних завдань

$$

  • Pipelines = швидко; Auto-класи = гнучко

Три повзунки з перемикачами і рука, що налаштовує один з них. Символізує більший контроль.

Робота з Hugging Face

AutoModels

  • Виберіть клас AutoModel, щоб напряму завантажити модель

$$

from transformers import AutoModelForSequenceClassification

# Завантажити попередньо натреновану модель класифікації тексту model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Робота з Hugging Face

AutoTokenizers

  • Підготуйте текстові вхідні дані
  • Рекомендовано використовувати токенізатор у парі з моделлю

$$

from transformers import AutoTokenizer


# Отримати токенізатор, спарений з моделлю tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Робота з Hugging Face

Токенізація тексту з AutoTokenizer

  • Токенізатори очищують вхід і ділять текст на токени

$$

tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")

# Токенізувати вхідний текст tokens = tokenizer.tokenize("AI: Helping robots think and humans overthink:)") print(tokens)
['ai', ':', 'helping', 'robots', 'think', 'and', 
 'humans', 'over', '##thi', '##nk', ':', ')']
Робота з Hugging Face

Різні моделі — різні токенізатори

  • Наша модель (distilbert-base-uncased):

    ['ai', ':', 'helping', 'robots', 'think', 'and', 'humans', 'over', '##thi',
    '##nk', ':', ')']
    
  • BERT-Base-Cased Tokenizer:

    ['AI', ':', 'Help', '##ing', 'robots', 'think', 'and', 'humans', 'over',
    '##thin', '##k', ':', ')']
    
Робота з Hugging Face

Побудова Pipeline з Auto-класами

from transformers import AutoModelForSequenceClassification,
AutoTokenizer, pipeline

# Завантажити модель і токенізатор my_model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english") my_tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english")
# Створити власний pipeline my_pipeline = pipeline( task="sentiment-analysis", model=my_model, tokenizer=my_tokenizer)
Робота з Hugging Face

Кейси для AutoModels і AutoTokenizers

$$

  • 🔧 Використовуйте для більшого контролю та налаштування

  • 📝 Передобробка тексту: очищення й токенізація під ваші кейси

  • 🏆 Пороги: віддавайте пріоритет ключовим класам у класифікації
  • 🚀 Складні конвеєри: керуйте багатостадійною обробкою та інтеграцією

$$ Більше контролю та налаштування

Робота з Hugging Face

Давайте потренуємось!

Робота з Hugging Face

Preparing Video For Download...