fastText (단어 표현·텍스트 분류)
fastText (단어 표현·텍스트 분류)
단어를 벡터로 표현하는 건 NLP의 기초인데, 피부여(subword) 정보까지 반영하려면 fastText가 좋아요. fastText는 Facebook Research가 만든 라이브러리로, 학습되지 않은 단어도 하위 단어 n-gram을 이용해 벡터를 만들어 낼 수 있는 게 특징이에요.
단어 임베딩(word vectors) 학습과 텍스트 분류(classifier) 두 가지 용도가 있어요. 157개 언어에 대해 사전 학습된 벡터도 제공해서, 바로 get_sentence_vector() 같은 API로 쓸 수 있죠.
핵심 개념
- subword 표현: 단어를 문자 n-gram으로 분해해 희귀·미등록 단어도 처리
- 단어 벡터: skip-gram 기반 사전 학습 벡터 제공
- 텍스트 분류: 지도 학습으로 라벨 분류기 학습