처리 파이프라인
처리 파이프라인
spaCy의 nlp 객체는 여러 컴포넌트를 순서대로 실행하는 파이프라인이에요. 토크나이저가 먼저 문서를 잘라내고, 그다음 태거·파서·NER 같은 컴포넌트가 순서대로 주석을 더해요.
파이프라인 확인·변경
import spacy
nlp = spacy.load("en_core_web_sm")
print(nlp.pipe_names) # ['tok2vec','tagger','parser','ner',...]
# 컴포넌트 추가
from spacy.language import Language
@Language.component("my_component")
def my_component(doc):
return doc
nlp.add_pipe("my_component", last=True)
확인 포인트
nlp("text")를 호출하면 파이프라인 전체가 순서대로 실행돼요.pipe_names로 활성 컴포넌트 목록을 확인하고,add_pipe/remove_pipe로 조절할 수 있어요.