말뭉치·리소스 데이터

말뭉치·리소스 데이터

NLTK는 토큰화나 품사 태깅에 필요한 말뭉치와 리소스를 별도 데이터로 배포해요. nltk.download()로 필요한 데이터셋을 받아서 로컬에 설치한 뒤 사용해요.

데이터 다운로드

import nltk

nltk.download("punkt")       # 토큰화 모델
nltk.download("averaged_perceptron_tagger")  # 품사 태거
nltk.download("stopwords")   # 불용어 목록

데이터 디렉터리

import nltk
print(nltk.data.path)  # 데이터 탐색 경로 목록

확인 포인트

  • 데이터는 기본적으로 사용자 데이터 디렉터리에 설치돼요.
  • 필요한 말뭉치가 없으면 LookupError가 나니 다운로드 여부를 먼저 확인해요.

출처: https://www.nltk.org/data.html

더 알아보기