spaCy로 배우는 자연어 처리
Azadeh Mobasher
Principal Data Scientist
{"I": 1, "got": 2, ...}
| 문장 | I | got | covid | coronavirus |
|---|---|---|---|---|
| I got covid | 1 | 2 | 3 | |
| I got coronavirus | 1 | 2 | 4 |
단어 벡터를 만드는 여러 접근법:
단어 벡터 예:
en_core_web_md는 20,000개 단어에 대해 300차원 벡터 제공
import spacy
nlp = spacy.load("en_core_web_md")
print(nlp.meta["vectors"])
>>> {'width': 300, 'vectors': 20000, 'keys': 514157,
'name': 'en_vectors', 'mode': 'default'}
nlp.vocab: 어휘집(Vocab 클래스) 접근nlp.vocab.strings: 어휘집의 단어 ID 접근import spacy
nlp = spacy.load("en_core_web_md")
like_id = nlp.vocab.strings["like"]
print(like_id)
>>> 18194338103975822726
.vocab.vectors: 모델의 단어 벡터 또는 ID로 특정 단어 벡터 접근print(nlp.vocab.vectors[like_id])
>>> array([-2.3334e+00, -1.3695e+00, -1.1330e+00, -6.8461e-01, ...])
spaCy로 배우는 자연어 처리