OpenAIDocumentEmbedder

OpenAIDocumentEmbedder

OpenAI 임베딩 모델로 문서 목록의 임베딩을 계산하고, 그 벡터를 각 문서의 embedding 필드에 저장하는 컴포넌트예요.

출처: 문서

본문

OpenAIDocumentEmbedder는 문서 목록의 임베딩을 계산하고 결과 벡터를 각 문서의 embedding 필드에 저장해요. OpenAI 임베딩 모델을 사용하죠.

이 컴포넌트가 계산하는 벡터는 문서 컬렉션에서 임베딩 검색을 수행하는 데 필요해요. 검색 시점에는 검색어를 나타내는 벡터를 문서들의 벡터와 비교해서 가장 유사하거나 관련 있는 문서를 찾아요.

Overview

호환되는 OpenAI 임베딩 모델 목록은 OpenAI 문서에서 확인할 수 있어요. OpenAIDocumentEmbedder의 기본 모델은 text-embedding-ada-002예요. 초기화할 때 model 파라미터로 다른 모델을 지정할 수 있어요.

이 컴포넌트는 문서 목록을 임베딩할 때 써요. 문자열 하나를 임베딩할 때는 OpenAITextEmbedder를 쓰세요.

이 컴포넌트는 기본적으로 OPENAI_API_KEY 환경 변수를 사용해요. 아니면 초기화할 때 api_key로 API 키를 넘길 수 있어요.

embedder = OpenAIDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))

메타데이터 임베딩

텍스트 문서에는 흔히 메타데이터가 따라와요. 메타데이터가 독특하고 의미적으로 유용하다면 문서 텍스트와 함께 임베딩해서 검색 품질을 높일 수 있어요.

Document Embedder를 쓰면 쉽게 할 수 있어요.

from haystack import Document
from haystack.components.embedders import OpenAIDocumentEmbedder


doc = Document(content="some text", meta={"title": "relevant title", "page number": 18})

embedder = OpenAIDocumentEmbedder(meta_fields_to_embed=["title"])

docs_w_embeddings = embedder.run(documents=[doc])["documents"]

더 알아보기 (Learn more)

단독으로 쓰기

from haystack import Document
from haystack.utils import Secret
from haystack.components.embedders import OpenAIDocumentEmbedder


doc = Document(content="I love pizza!")

document_embedder = OpenAIDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))

result = document_embedder.run([doc])
print(result["documents"][0].embedding)

# [0.017020374536514282, -0.023255806416273117, ...]

info: OPENAI_API_KEY는 파라미터로 설정하기보다 환경 변수로 설정하는 것을 권장해요.

파이프라인에서 쓰기

from haystack import Document, Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.embedders import OpenAITextEmbedder, OpenAIDocumentEmbedder
from haystack.components.writers import DocumentWriter
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever


document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")

documents = [
    Document(content="My name is Wolfgang and I live in Berlin"),
    Document(content="I saw a black horse running"),
    Document(content="Germany has many big cities"),
]

indexing_pipeline = Pipeline()
indexing_pipeline.add_component("embedder", OpenAIDocumentEmbedder())
indexing_pipeline.add_component("writer", DocumentWriter(document_store=document_store))
indexing_pipeline.connect("embedder", "writer")

indexing_pipeline.run({"embedder": {"documents": documents}})

query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", OpenAITextEmbedder())
query_pipeline.add_component(
    "retriever",
    InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")

query = "Who lives in Berlin?"

result = query_pipeline.run({"text_embedder": {"text": query}})

print(result["retriever"]["documents"][0])

# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)