언어적 특징 (품사·구문·개체명)

언어적 특징 (품사·구문·개체명)

spaCy에 원시 텍스트를 넣으면 Doc 객체가 나오고, 이 객체에는 토큰·품사·의존 구문·개체명 같은 다양한 언어 주석이 붙어요. 그냥 문자열을 처리하는 것보다 훨씬 유용한 정보를 얻을 수 있는 이유예요.

기본 사용

import spacy

nlp = spacy.load("en_core_web_sm")
doc = nlp("Apple is looking at buying a U.K. startup for $1 billion.")

for token in doc:
    print(token.text, token.lemma_, token.pos_, token.dep_)

확인 포인트

  • spaCy는 문자열을 해시 값으로 인코딩해 메모리를 아껴요. 읽을 수 있는 문자열을 얻으려면 속성 이름 뒤에 밑줄을 붙여요(예: token.lemma_).
  • 개체명은 doc.ents로 순회하며 ent.label_로 종류를 확인할 수 있어요.

출처: https://spacy.io/usage/linguistic-features

더 알아보기