FastText 모델

FastText 모델

Gensim은 fastText 모델도 지원해요. 단어를 통째로 보는 대신 문자 n-gram까지 반영해서, 훈련 때 못 본 단어(subword)도 벡터를 만들 수 있는 게 특징이죠.

학습 예시

from gensim.models import FastText

sentences = [["deep", "learning", "is", "fun"]]
model = FastText(sentences, vector_size=100, window=5, min_count=1)

미등록 단어 벡터

vec = model.wv["unseenword!"]

확인 포인트

  • 사전에 없는 단어도 문자 n-gram 조합으로 벡터를 만들어 내요.
  • 단어 벡터와 별도로 model.wv.vectors_ngrams에 n-gram 벡터가 저장돼요.

출처: https://radimrehurek.com/gensim/models/fasttext.html

더 알아보기