사전 학습 단어 벡터
사전 학습 단어 벡터
fastText는 위키백과 기반으로 훈련된 단어 벡터를 여러 언어로 배포해요. 이 벡터는 skip-gram 모델을 기본 파라미터로 써서 얻은 300차원 표현이에요.
벡터 받기
wiki.<lang>.zip— 위키백과 기반 단어 벡터 (다수 언어)- 더 최신 멀티링궐 벡터는 크롤 기반 벡터에서 받을 수 있어요.
import fasttext
model = fasttext.load_model("wiki.ko.bin")
print(model.get_word_vector("한국"))
확인 포인트
- 벡터 파일은
.bin(바이너리)과.vec(텍스트) 두 형태로 제공돼요. - 하위 단어 정보 덕분에 사전에 없는 단어도 임베딩을 얻을 수 있어요.