말뭉치·리소스 데이터
말뭉치·리소스 데이터
NLTK는 토큰화나 품사 태깅에 필요한 말뭉치와 리소스를 별도 데이터로 배포해요. nltk.download()로 필요한 데이터셋을 받아서 로컬에 설치한 뒤 사용해요.
데이터 다운로드
import nltk
nltk.download("punkt") # 토큰화 모델
nltk.download("averaged_perceptron_tagger") # 품사 태거
nltk.download("stopwords") # 불용어 목록
데이터 디렉터리
import nltk
print(nltk.data.path) # 데이터 탐색 경로 목록
확인 포인트
- 데이터는 기본적으로 사용자 데이터 디렉터리에 설치돼요.
- 필요한 말뭉치가 없으면
LookupError가 나니 다운로드 여부를 먼저 확인해요.