Gensim (토픽 모델링·벡터 표현)

Gensim (토픽 모델링·벡터 표현)

대규모 말뭉치를 다룰 때 메모리에 다 담지 못해서 막히는 경우가 많아요. Gensim은 데이터 스트리밍 방식으로 아주 큰 말뭉치도 처리하면서 word2vec 같은 단어 임베딩과 LDA 같은 토픽 모델링을 학습할 수 있는 라이브러리예요. 핵심 알고리즘은 C로 최적화돼서 속도도 빨라요.

문서를 벡터로 표현하고, 그 벡터들 사이의 유사도를 계산해 관련 문서를 찾는 흐름이 기본이에요. "토픽 모델링 for humans"이라는 슬로건처럼, 사람이 쓰기 쉽게 설계됐죠.

핵심 개념

  • 말뭉치 스트리밍: RAM에 다 못 담는 큰 데이터도 처리
  • 워드 임베딩: word2vec, fastText 등 벡터 표현
  • 토픽 모델링: LDA, LSI 등 토픽 추출
  • 유사도 검색: 벡터 공간에서 관련 문서 찾기

출처: https://radimrehurek.com/gensim/

더 알아보기