사전 학습 단어 벡터

사전 학습 단어 벡터

fastText는 위키백과 기반으로 훈련된 단어 벡터를 여러 언어로 배포해요. 이 벡터는 skip-gram 모델을 기본 파라미터로 써서 얻은 300차원 표현이에요.

벡터 받기

  • wiki.<lang>.zip — 위키백과 기반 단어 벡터 (다수 언어)
  • 더 최신 멀티링궐 벡터는 크롤 기반 벡터에서 받을 수 있어요.
import fasttext

model = fasttext.load_model("wiki.ko.bin")
print(model.get_word_vector("한국"))

확인 포인트

  • 벡터 파일은 .bin(바이너리)과 .vec(텍스트) 두 형태로 제공돼요.
  • 하위 단어 정보 덕분에 사전에 없는 단어도 임베딩을 얻을 수 있어요.

출처: https://fasttext.cc/docs/en/pretrained-vectors.html

더 알아보기