어노테이터 개념

어노테이터 개념

Spark NLP에서 NLP 파이프라인은 여러 **어노테이터(annotator)**가 체인처럼 연결된 구조예요. 각 단계는 토큰화(tokenization), 정규화, 의존 구문 분석(dependency parsing) 같은 특정 태스크를 수행하고, 입력으로 어노테이션(annotation)을 받아 새 어노테이션을 출력해요.

어노테이터는 텍스트 문서에 특정 NLP 태스크를 수행하고 메타데이터를 추가하는 컴포넌트예요. 예를 들어 Tokenizer, SentenceDetector, Lemmatizer 같은 어노테이터가 있고, 이들을 조합해 파이프라인을 만들면 됩니다. Spark ML 기반이라 분산 스파크 클러스터에서 자연스럽게 확장돼요.

설치 한 줄이면 시작할 수 있어요.

pip install johnsnowlabs

문서 분류에는 ClassifierDLModel(이미 훈련된 모델 로드)과 ClassifierDL(훈련용)을 쓰고, 다중 라벨 분류에는 MultiClassifierDLApproach를 써요. 각 어노테이터가 입력·출력 어노테이션 타입을 정의하기 때문에, 파이프라인을 짤 때 어느 어노테이터가 어떤 입력을 원하고 무엇을 내놓는지 파악하는 게 중요해요.

더 알아보기