Auto 모델과 토크나이저

Hugging Face 활용하기

Jacob H. Marquez

Lead Data Engineer

파이프라인: 빠르고 간단함

from transformers import pipeline  

my_pipeline = pipeline(
    "text-classification",
    model="distilbert-base-uncased-finetuned-sst-2-english"))

print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Hugging Face 활용하기

Auto 클래스: 유연하고 강력함

$$

  • Auto 클래스: 모델·토크나이저에 유연하게 접근
  • 모델 동작과 출력에 더 많은 제어
  • 고급 작업에 적합

$$

  • 파이프라인 = 빠름; Auto 클래스 = 유연함

세 개의 슬라이더와 토글, 하나를 조정하는 손. 더 많은 제어를 의미.

Hugging Face 활용하기

AutoModels

  • AutoModel 클래스로 모델을 바로 다운로드합니다

$$

from transformers import AutoModelForSequenceClassification

# 사전 학습된 텍스트 분류 모델 다운로드 model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Hugging Face 활용하기

AutoTokenizers

  • 텍스트 입력 데이터를 준비합니다
  • 모델과 짝지어진 토크나이저 사용 권장

$$

from transformers import AutoTokenizer


# 모델과 짝지어진 토크나이저 가져오기 tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english" )
Hugging Face 활용하기

AutoTokenizer로 텍스트 토크나이즈

  • 토크나이저는 입력을 정제하고 텍스트를 분할하여 토큰으로 만듭니다

$$

tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")

# 입력 텍스트 토크나이즈 tokens = tokenizer.tokenize("AI: Helping robots think and humans overthink:)") print(tokens)
['ai', ':', 'helping', 'robots', 'think', 'and', 
 'humans', 'over', '##thi', '##nk', ':', ')']
Hugging Face 활용하기

모델마다 다른 토크나이저

  • 우리 모델(distilbert-base-uncased):

    ['ai', ':', 'helping', 'robots', 'think', 'and', 'humans', 'over', '##thi',
    '##nk', ':', ')']
    
  • BERT-Base-Cased 토크나이저:

    ['AI', ':', 'Help', '##ing', 'robots', 'think', 'and', 'humans', 'over',
    '##thin', '##k', ':', ')']
    
Hugging Face 활용하기

Auto 클래스으로 파이프라인 구축

from transformers import AutoModelForSequenceClassification,
AutoTokenizer, pipeline

# 모델과 토크나이저 다운로드 my_model = AutoModelForSequenceClassification.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english") my_tokenizer = AutoTokenizer.from_pretrained( "distilbert-base-uncased-finetuned-sst-2-english")
# 커스텀 파이프라인 생성 my_pipeline = pipeline( task="sentiment-analysis", model=my_model, tokenizer=my_tokenizer)
Hugging Face 활용하기

AutoModel과 AutoTokenizer 활용 사례

$$

  • 🔧 더 큰 제어와 사용자 지정에 사용

  • 📝 텍스트 전처리: 용도에 맞게 정제·토크나이즈

  • 🏆 임곗값 설정: 분류에서 핵심 카테고리 우선
  • 🚀 복합 워크플로우: 다단계 처리·통합 제어

$$ 더 많은 제어와 사용자 지정

Hugging Face 활용하기

Ayo berlatih!

Hugging Face 활용하기

Preparing Video For Download...