파이프라인 시작하기
파이프라인 시작하기
텍스트에 어노테이션을 하려면 먼저 Pipeline을 초기화해요. 파이프라인은 일련의 Processor를 미리 로드하고 연결하며, 각 프로세서는 토큰화·구문 분석·엔티티 인식 같은 특정 NLP 태스크를 수행해요.
최소 예제로 영어 기본 파이프라인을 만들 수 있어요.
import stanza
stanza.download('en') # 영어 모델 미리 다운로드 (필요 시 Pipeline이 자동 다운로드)
nlp = stanza.Pipeline('en') # 영어 기본 신경 파이프라인 설정
doc = nlp("Barack Obama was born in Hawaii.")
프로세서를 지정하고 싶으면 쉼표로 구분된 문자열을 넘겨요.
nlp = stanza.Pipeline('zh', processors='tokenize,pos')
모델 패키지도 지정할 수 있어요.
nlp = stanza.Pipeline('de', processors='tokenize,mwt', package='gsd')
nlp = stanza.Pipeline('nl', processors={'ner': 'conll02'})
만든 파이프라인에 텍스트를 넣으면 Document 객체가 반환되고, 이후 doc.sentences, doc.entities 등으로 어노테이션에 접근할 수 있어요. GPU가 있다면 use_gpu=True로, 배치 크기는 pos_batch_size=3000처럼 조정할 수 있어요.