AzureOpenAITextEmbedder

AzureOpenAITextEmbedder

임베딩 검색을 수행할 때 이 컴포넌트로 쿼리를 벡터로 변환해요. 그러면 임베딩 Retriever가 유사하거나 관련 있는 문서를 찾습니다.

파이프라인에서 가장 흔한 위치: 쿼리/RAG 파이프라인에서 임베딩 Retriever 앞 필수 init 변수: api_key(AZURE_OPENAI_API_KEY 환경 변수로 설정 가능), azure_endpoint(Azure에 배포된 모델의 엔드포인트) 필수 run 변수: text — 문자열 출력 변수: embedding(float 숫자 목록), meta(메타데이터 딕셔너리) API reference: Embedders GitHub link: https://github.com/deepset-ai/haystack/blob/main/haystack/components/embedders/azure_text_embedder.py Package name: haystack-ai

출처: 문서

본문

Overview

AzureOpenAITextEmbedder는 OpenAI 임베딩 모델을 사용해 문자열을 그 의미를 포착하는 벡터로 변환해요. Azure에 배포된 모델로 텍스트·문서 임베딩에 Azure 인지 서비스(cognitive services)를 사용하죠.

호환되는 임베딩 모델 목록은 Azure 문서를 참고하세요. AzureOpenAITextEmbedder의 기본 모델은 text-embedding-ada-002예요.

AzureOpenAITextEmbedder는 단순 문자열(쿼리 같은)을 벡터로 임베딩할 때 사용해요. 문서 목록을 임베딩할 때는 계산된 임베딩(벡터라고도 함)으로 문서를 채우는 AzureOpenAIDocumentEmbedder를 사용하세요.

Azure 컴포넌트를 쓰려면 Azure OpenAI API 키와 Azure OpenAI 엔드포인트가 필요합니다. 자세한 내용은 Azure 문서에서 확인할 수 있어요.

컴포넌트는 기본적으로 AZURE_OPENAI_API_KEY 또는 AZURE_OPENAI_AD_TOKEN 환경 변수를 사용합니다. 또는 초기화 때 api_key나 azure_ad_token을 전달할 수 있어요:

client = AzureOpenAITextEmbedder(
    azure_endpoint="<Your Azure endpoint e.g. `https://your-company.azure.openai.com/>",
    api_key=Secret.from_token("<your-api-key>"),
    azure_deployment="<a model name>",
)

info 초기화 파라미터보다 환경 변수를 쓰는 걸 권장합니다.

Usage

On its own

컴포넌트를 단독으로 사용하는 방법은 이렇습니다:

from haystack.components.embedders import AzureOpenAITextEmbedder

text_to_embed = "I love pizza!"
text_embedder = AzureOpenAITextEmbedder()
print(text_embedder.run(text_to_embed))
# {'embedding': [0.017020374536514282, -0.023255806416273117, ...],
# 'meta': {'model': 'text-embedding-ada-002-v2',
# 'usage': {'prompt_tokens': 4, 'total_tokens': 4}}}

In a pipeline

from haystack import Document
from haystack import Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.embedders import (
    AzureOpenAITextEmbedder,
    AzureOpenAIDocumentEmbedder,
)
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever

document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
    Document(content="My name is Wolfgang and I live in Berlin"),
    Document(content="I saw a black horse running"),
    Document(content="Germany has many big cities"),
]
document_embedder = AzureOpenAIDocumentEmbedder()
documents_with_embeddings = document_embedder.run(documents)["documents"]
document_store.write_documents(documents_with_embeddings)

query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", AzureOpenAITextEmbedder())
query_pipeline.add_component(
    "retriever",
    InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")

query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)

더 알아보기 (Learn more)