빠르게 시작하기
빠르게 시작하기
Spark NLP를 쓰려면 우선 패키지에서 import하고 SparkSession을 시작해요.
from sparknlp.base import *
from sparknlp.annotator import *
from sparknlp.pretrained import PretrainedPipeline
import sparknlp
# start() 함수는 gpu, apple_silicon, memory 세 파라미터를 받아요
# sparknlp.start(gpu=True) → GPU 지원으로 시작
# sparknlp.start(apple_silicon=True) → macOS M1·M2 지원
# sparknlp.start(memory="16G") → SparkSession 기본 드라이버 메모리 변경
spark = sparknlp.start()
사전 학습 파이프라인을 내려받아 바로 어노테이션해요.
pipeline = PretrainedPipeline('explain_document_dl', lang='en')
text = '''
The Mona Lisa is a 16th century oil painting created by Leonardo.
It's held at the Louvre in Paris.
'''
result = pipeline.annotate(text)
print(list(result.keys()))
# ['entities', 'stem', 'checked', 'lemma', 'document', 'pos', 'token', 'ner', 'embeddings', 'sentence']
print(result['entities'])
# ['Mona Lisa', 'Leonardo', 'Louvre', 'Paris']
start()의 three 파라미터(gpu, apple_silicon, memory)를 상황에 맞게 켜면 되고, 문장 단위로 어노테이션 결과가 필드별로 나오는 걸 볼 수 있어요.