AzureOpenAIDocumentEmbedder
AzureOpenAIDocumentEmbedder
문서 목록의 임베딩을 계산하고 얻은 벡터를 각 문서의 embedding 필드에 저장하는 컴포넌트예요. Azure에 배포된 모델로 텍스트·문서 임베딩에 Azure 인지 서비스(cognitive services)를 사용하죠.
파이프라인에서 가장 흔한 위치: DocumentWriter 앞
필수 init 변수: api_key(AZURE_OPENAI_API_KEY 환경 변수로 설정 가능), azure_endpoint(Azure에 배포된 모델의 엔드포인트)
필수 run 변수: documents — 문서 목록
출력 변수: documents(임베딩이 추가된 문서 목록), meta(메타데이터 딕셔너리)
API reference: Embedders
GitHub link: https://github.com/deepset-ai/haystack/blob/main/haystack/components/embedders/azure_document_embedder.py
Package name: haystack-ai
출처: 문서
본문
Overview
이 컴포넌트가 계산한 벡터는 문서 모음에 대한 임베딩 검색을 수행하는 데 필요해요. 검색 시점에는 쿼리를 나타내는 벡터가 문서들의 벡터와 비교되어 가장 유사하거나 관련 있는 문서를 찾습니다.
호환되는 임베딩 모델 목록은 Azure 문서를 참고하세요. AzureOpenAITextEmbedder의 기본 모델은 text-embedding-ada-002예요.
이 컴포넌트는 문서 목록을 임베딩할 때 사용해야 해요. 문자열을 임베딩하려면 AzureOpenAITextEmbedder를 사용하세요.
Azure 컴포넌트를 쓰려면 Azure OpenAI API 키와 Azure OpenAI 엔드포인트가 필요합니다. 자세한 내용은 Azure 문서에서 확인할 수 있어요.
컴포넌트는 기본적으로 AZURE_OPENAI_API_KEY 또는 AZURE_OPENAI_AD_TOKEN 환경 변수를 사용합니다. 또는 초기화 때 api_key나 azure_ad_token을 전달할 수 있어요:
client = AzureOpenAIDocumentEmbedder(
azure_endpoint="<Your Azure endpoint e.g. `https://your-company.azure.openai.com/>",
api_key=Secret.from_token("<your-api-key>"),
azure_deployment="<a model name>",
)
info 초기화 파라미터보다 환경 변수를 쓰는 걸 권장합니다.
Embedding Metadata
텍스트 문서에는 보통 메타데이터가 따라와요. 메타데이터가 구별적이고 의미적으로 가치 있다면, 문서 텍스트와 함께 임베딩하면 검색 품질을 높일 수 있어요.
Document Embedder로 쉽게 할 수 있습니다:
from haystack import Document
from haystack.components.embedders import AzureOpenAIDocumentEmbedder
doc = Document(content="some text", meta={"title": "relevant title", "page number": 18})
embedder = AzureOpenAIDocumentEmbedder(meta_fields_to_embed=["title"])
docs_w_embeddings = embedder.run(documents=[doc])["documents"]
Usage
On its own
from haystack import Document
from haystack.components.embedders import AzureOpenAIDocumentEmbedder
doc = Document(content="I love pizza!")
document_embedder = AzureOpenAIDocumentEmbedder()
result = document_embedder.run([doc])
print(result["documents"][0].embedding)
# [0.017020374536514282, -0.023255806416273117, ...]
In a pipeline
from haystack import Document, Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.embedders import (
AzureOpenAITextEmbedder,
AzureOpenAIDocumentEmbedder,
)
from haystack.components.writers import DocumentWriter
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
Document(content="My name is Wolfgang and I live in Berlin"),
Document(content="I saw a black horse running"),
Document(content="Germany has many big cities"),
]
indexing_pipeline = Pipeline()
indexing_pipeline.add_component("embedder", AzureOpenAIDocumentEmbedder())
indexing_pipeline.add_component("writer", DocumentWriter(document_store=document_store))
indexing_pipeline.connect("embedder", "writer")
indexing_pipeline.run({"embedder": {"documents": documents}})
query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", AzureOpenAITextEmbedder())
query_pipeline.add_component(
"retriever",
InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")
query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)
더 알아보기 (Learn more)
- AzureOpenAITextEmbedder — 문자열 임베딩
- Embedders — Embedder 컴포넌트