텍스트 분류

텍스트 분류

Spark NLP로 텍스트 분류를 하려면 사전 학습 파이프라인을 쓰거나 직접 훈련해요. 사전 학습 파이프라인은 PretrainedPipeline으로 내려받아 바로 분류할 수 있어요.

분류 모델을 직접 훈련하려면 ClassifierDL 어노테이터와 훈련 데이터로 Spark ML 파이프라인을 구성해 fit을 호출하면 돼요. 이미 훈련된 모델을 로드할 땐 ClassifierDLModel을 사용해요.

다중 라벨 분류가 필요하면 MultiClassifierDLApproach를 사용해요. 하나의 문서가 여러 범주에 동시에 걸리는 경우에 유용해요. 공식 문서에서 각 어노테이터의 예제와 파라미터를 확인하면 빠르게 시작할 수 있어요.

Spark NLP는 Apache Spark ML 위에 구축돼서, 대용량 텍스트 데이터를 단일 노드 메모리 한계를 넘어 분산 처리할 수 있다는 게 가장 큰 장점이에요. 사전 학습 파이프라인·모델이 많아서 특정 태스크를 손쉽게 시작할 수 있죠.

더 알아보기