언어적 특징 (품사·구문·개체명)
언어적 특징 (품사·구문·개체명)
spaCy에 원시 텍스트를 넣으면 Doc 객체가 나오고, 이 객체에는 토큰·품사·의존 구문·개체명 같은 다양한 언어 주석이 붙어요. 그냥 문자열을 처리하는 것보다 훨씬 유용한 정보를 얻을 수 있는 이유예요.
기본 사용
import spacy
nlp = spacy.load("en_core_web_sm")
doc = nlp("Apple is looking at buying a U.K. startup for $1 billion.")
for token in doc:
print(token.text, token.lemma_, token.pos_, token.dep_)
확인 포인트
- spaCy는 문자열을 해시 값으로 인코딩해 메모리를 아껴요. 읽을 수 있는 문자열을 얻으려면 속성 이름 뒤에 밑줄을 붙여요(예:
token.lemma_). - 개체명은
doc.ents로 순회하며ent.label_로 종류를 확인할 수 있어요.