크롤 기반 단어 벡터
크롤 기반 단어 벡터
위키백과 벡터보다 훨씬 넓은 범위의 어휘를 담고 싶다면, Common Crawl에서 훈련한 157개 언어 단어 벡터를 쓸 수 있어요. 2백만 단어 내외의 어휘를 가진 300차원 벡터예요.
받는 방법
import fasttext.util
# 최신 벡터 다운로드
fasttext.util.download_model("en", if_exists="ignore")
ft = fasttext.load_model("cc.en.300.bin")
print(ft.get_word_vector("internet"))
확인 포인트
- 모델 이름은
cc.<lang>.300.bin형태예요 (예:cc.en.300.bin,cc.ko.300.bin). fasttext.util.reduce_model()로 차원을 줄여 메모리를 아낄 수도 있어요.