FastText 모델
FastText 모델
Gensim은 fastText 모델도 지원해요. 단어를 통째로 보는 대신 문자 n-gram까지 반영해서, 훈련 때 못 본 단어(subword)도 벡터를 만들 수 있는 게 특징이죠.
학습 예시
from gensim.models import FastText
sentences = [["deep", "learning", "is", "fun"]]
model = FastText(sentences, vector_size=100, window=5, min_count=1)
미등록 단어 벡터
vec = model.wv["unseenword!"]
확인 포인트
- 사전에 없는 단어도 문자 n-gram 조합으로 벡터를 만들어 내요.
- 단어 벡터와 별도로
model.wv.vectors_ngrams에 n-gram 벡터가 저장돼요.