처리 파이프라인

처리 파이프라인

spaCy의 nlp 객체는 여러 컴포넌트를 순서대로 실행하는 파이프라인이에요. 토크나이저가 먼저 문서를 잘라내고, 그다음 태거·파서·NER 같은 컴포넌트가 순서대로 주석을 더해요.

파이프라인 확인·변경

import spacy

nlp = spacy.load("en_core_web_sm")
print(nlp.pipe_names)  # ['tok2vec','tagger','parser','ner',...]

# 컴포넌트 추가
from spacy.language import Language

@Language.component("my_component")
def my_component(doc):
    return doc

nlp.add_pipe("my_component", last=True)

확인 포인트

  • nlp("text")를 호출하면 파이프라인 전체가 순서대로 실행돼요.
  • pipe_names로 활성 컴포넌트 목록을 확인하고, add_pipe/remove_pipe로 조절할 수 있어요.

출처: https://spacy.io/usage/processing-pipelines

더 알아보기