SentenceTransformersSparseDocumentEmbedder

SentenceTransformersSparseDocumentEmbedder

Sentence Transformers 모델을 사용해 문서 목록에 희소(sparse) 임베딩을 추가하는 컴포넌트예요.

출처: 문서

본문

항목 내용
파이프라인에서 가장 흔한 위치 인덱싱 파이프라인에서 DocumentWriter 앞
필수 run 변수 documents: 문서 목록
출력 변수 documents: 희소 임베딩으로 풍부해진 문서 목록
API reference Sentence Transformers
GitHub 링크 sentence_transformers 통합
패키지 이름 sentence-transformers-haystack

문자열의 희소 임베딩을 계산하려면 SentenceTransformersSparseTextEmbedder를 사용하세요.

개요

SentenceTransformersSparseDocumentEmbedder는 문서 목록의 희소 임베딩을 계산해 얻은 벡터를 각 문서의 sparse_embedding 필드에 저장해요. Sentence Transformers 라이브러리가 지원하는 희소 임베딩 모델을 사용하죠.

이 컴포넌트가 계산한 벡터는 문서 컬렉션에 대해 희소 임베딩 검색을 수행하는 데 필요해요. 검색 시점에 쿼리를 나타내는 희소 벡터를 문서들의 벡터와 비교해 가장 유사하거나 관련 있는 문서를 찾아요.

호환 모델

기본 임베딩 모델은 prithivida/Splade_PP_en_v2예요. 컴포넌트 초기화 시 model 파라미터로 다른 모델을 지정할 수 있어요.

호환 모델은 SPLADE(SParse Lexical AnD Expansion)에 기반해요. SPLADE는 텍스트의 희소 표현을 만드는 기법으로, 임베딩의 각 0이 아닌 값은 어휘에서 용어의 중요도 가중치를 나타내요. 이 접근 방식은 학습된 희소 표현의 장점과 전통적인 희소 검색 방법의 효율성을 결합하죠. 자세한 내용은 희소 임베딩 기반 Retriever를 설명하는 우리 문서를 참고하세요.

호환되는 SPLADE 모델은 Hugging Face Model Hub에서 찾을 수 있어요.

인증

Hugging Face API 토큰 인증은 비공개 또는 게이트 모델에만 필요해요.

컴포넌트는 HF_API_TOKEN 또는 HF_TOKEN 환경 변수를 사용하거나, 초기화 시 Hugging Face API 토큰을 전달할 수 있어요. 자세한 내용은 Secret Management 페이지를 참고하세요.

from haystack.utils import Secret
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersSparseDocumentEmbedder,
)

document_embedder = SentenceTransformersSparseDocumentEmbedder(
    token=Secret.from_token("<your-api-key>"),
)

백엔드 옵션

이 컴포넌트는 모델 실행을 위해 여러 백엔드를 지원해요.

  • torch (기본값): 표준 PyTorch 백엔드
  • onnx: 더 빠른 추론을 위한 최적화된 ONNX Runtime 백엔드
  • openvino: Intel 하드웨어에서 추가 최적화를 제공하는 Intel OpenVINO 백엔드

초기화 중에 백엔드를 지정할 수 있어요:

embedder = SentenceTransformersSparseDocumentEmbedder(
    model="prithivida/Splade_PP_en_v2",
    backend="onnx",
)

가속 및 양자화 옵션에 대한 자세한 내용은 Sentence Transformers 문서를 참고하세요.

메타데이터 임베딩

텍스트 문서에는 흔히 메타데이터가 포함돼요. 메타데이터가 독특하고 의미적으로 유의미하다면, 문서 텍스트와 함께 임베딩해 검색을 개선할 수 있어요.

Sparse Document Embedder를 사용하면 쉽게 할 수 있어요:

from haystack import Document
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersSparseDocumentEmbedder,
)

doc = Document(content="some text", meta={"title": "relevant title", "page number": 18})
embedder = SentenceTransformersSparseDocumentEmbedder(meta_fields_to_embed=["title"])
docs_w_sparse_embeddings = embedder.run(documents=[doc])["documents"]

사용법

SentenceTransformersSparseDocumentEmbedder를 사용하려면 sentence-transformers-haystack 패키지를 설치하세요:

pip install sentence-transformers-haystack

단독으로 사용하기

from haystack import Document
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersSparseDocumentEmbedder,
)

doc = Document(content="I love pizza!")
doc_embedder = SentenceTransformersSparseDocumentEmbedder()
result = doc_embedder.run([doc])
print(result["documents"][0].sparse_embedding)
# SparseEmbedding(indices=[999, 1045, ...], values=[0.918, 0.867, ...])

파이프라인에서 사용하기

현재 희소 임베딩 검색은 QdrantDocumentStore만 지원해요.

먼저 필요한 패키지를 설치하세요:

pip install qdrant-haystack

그런 다음 이 파이프라인을 시도해 보세요:

from haystack import Document, Pipeline
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersSparseDocumentEmbedder,
    SentenceTransformersSparseTextEmbedder,
)
from haystack.components.writers import DocumentWriter
from haystack_integrations.components.retrievers.qdrant import (
    QdrantSparseEmbeddingRetriever,
)
from haystack_integrations.document_stores.qdrant import QdrantDocumentStore
from haystack.document_stores.types import DuplicatePolicy

document_store = QdrantDocumentStore(
    ":memory:",
    recreate_index=True,
    use_sparse_embeddings=True,
)

documents = [
    Document(content="My name is Wolfgang and I live in Berlin"),
    Document(content="I saw a black horse running"),
    Document(content="Germany has many big cities"),
    Document(content="Sentence Transformers provides sparse embedding models."),
]

# Indexing pipeline
indexing_pipeline = Pipeline()
indexing_pipeline.add_component(
    "sparse_document_embedder",
    SentenceTransformersSparseDocumentEmbedder(),
)
indexing_pipeline.add_component(
    "writer",
    DocumentWriter(document_store=document_store, policy=DuplicatePolicy.OVERWRITE),
)
indexing_pipeline.connect("sparse_document_embedder", "writer")
indexing_pipeline.run({"sparse_document_embedder": {"documents": documents}})

# Query pipeline
query_pipeline = Pipeline()
query_pipeline.add_component(
    "sparse_text_embedder",
    SentenceTransformersSparseTextEmbedder(),
)
query_pipeline.add_component(
    "sparse_retriever",
    QdrantSparseEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect(
    "sparse_text_embedder.sparse_embedding",
    "sparse_retriever.query_sparse_embedding",
)

query = "Who provides sparse embedding models?"
result = query_pipeline.run({"sparse_text_embedder": {"text": query}})
print(result["sparse_retriever"]["documents"][0])
# Document(id=...,
#  content: 'Sentence Transformers provides sparse embedding models.',
#  score: 0.75...)

더 알아보기 (Learn more)