NvidiaDocumentEmbedder

NvidiaDocumentEmbedder

문서 목록의 임베딩을 계산해서 각 문서의 embedding 필드에 저장하는 컴포넌트예요.

출처: 문서

본문

NvidiaDocumentEmbedder는 문서의 내용으로 임베딩을 만들고 그 문서에 더해줘요.

이 컴포넌트는 NVIDIA NIM으로 자체 호스팅한 모델이나 NVIDIA API Catalog에 호스팅된 모델과 함께 쓸 수 있어요.

문자열 하나를 임베딩하려면 NvidiaTextEmbedder를 쓰세요.

더 알아보기 (Learn more)

NvidiaDocumentEmbedder를 쓰려면 nvidia-haystack 패키지를 설치해요.

pip install nvidia-haystack

NVIDIA API Catalog에 있는 모든 임베딩 모델이나 NVIDIA NIM으로 배포한 모델과 함께 쓸 수 있어요. 자세한 내용은 NIM for Embedding을 참고하세요.

단독으로 쓰기

NVIDIA API Catalog의 모델을 쓰려면 api_url과 API 키를 지정해야 해요. API 키는 NVIDIA API Catalog에서 얻을 수 있어요.

NvidiaDocumentEmbedder는 기본적으로 NVIDIA_API_KEY 환경 변수를 사용해요. 아니면 초기화할 때 api_key 파라미터로 API 키를 넘길 수 있어요.

from haystack import Document
from haystack.utils.auth import Secret
from haystack_integrations.components.embedders.nvidia import NvidiaDocumentEmbedder


documents = [
    Document(content="A transformer is a deep learning architecture"),
    Document(content="Large language models use transformer architectures"),
]

embedder = NvidiaDocumentEmbedder(
    model="nvidia/nv-embedqa-e5-v5",
    api_url="https://integrate.api.nvidia.com/v1",
    api_key=Secret.from_token("<your-api-key>"),
)

result = embedder.run(documents=documents)
print(result["documents"])
print(result["meta"])

로컬에 배포한 모델을 쓰려면 api_url을 localhost로 설정하고 api_key를 None으로 두세요.

from haystack import Document
from haystack_integrations.components.embedders.nvidia import NvidiaDocumentEmbedder


documents = [
    Document(content="A transformer is a deep learning architecture"),
    Document(content="Large language models use transformer architectures"),
]

embedder = NvidiaDocumentEmbedder(
    model="nvidia/nv-embedqa-e5-v5",
    api_url="http://localhost:9999/v1",
    api_key=None,
)

result = embedder.run(documents=documents)
print(result["documents"])
print(result["meta"])

파이프라인에서 쓰기

다음 예제는 RAG 파이프라인에서 NvidiaDocumentEmbedder를 쓰는 방법을 보여줘요.

from haystack import Pipeline, Document
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.writers import DocumentWriter
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
from haystack.utils.auth import Secret
from haystack_integrations.components.embedders.nvidia import (
    NvidiaTextEmbedder,
    NvidiaDocumentEmbedder,
)


document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")

documents = [
    Document(content="My name is Wolfgang and I live in Berlin"),
    Document(content="I saw a black horse running"),
    Document(content="Germany has many big cities"),
]

indexing_pipeline = Pipeline()
indexing_pipeline.add_component(
    "embedder",
    NvidiaDocumentEmbedder(
        model="nvidia/nv-embedqa-e5-v5",
        api_url="https://integrate.api.nvidia.com/v1",
        api_key=Secret.from_token("<your-api-key>"),
    ),
)
indexing_pipeline.add_component("writer", DocumentWriter(document_store=document_store))
indexing_pipeline.connect("embedder", "writer")

indexing_pipeline.run({"embedder": {"documents": documents}})

query_pipeline = Pipeline()
query_pipeline.add_component(
    "text_embedder",
    NvidiaTextEmbedder(
        model="nvidia/nv-embedqa-e5-v5",
        api_url="https://integrate.api.nvidia.com/v1",
        api_key=Secret.from_token("<your-api-key>"),
    ),
)
query_pipeline.add_component(
    "retriever",
    InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")

query = "Who lives in Berlin?"

result = query_pipeline.run({"text_embedder": {"text": query}})

print(result["retriever"]["documents"][0])

관련 자료