OpenAI 텍스트 임베더
OpenAI 텍스트 임베더 (OpenAITextEmbedder)
OpenAITextEmbedder는 OpenAI 임베딩 모델을 이용해 문자열을 그 의미를 담은 벡터로 바꿔 주는 컴포넌트예요. 임베딩 검색을 수행할 때 쿼리를 벡터로 변환하는 역할을 맡고, 그다음 임베딩 Retriever가 그 벡터와 비슷하거나 관련 있는 문서를 찾아줘요. 보통 RAG 파이프라인에서 임베딩 Retriever 앞에 위치해요.
출처: 공식문서
주요 정보
| 항목 | 값 |
|---|---|
| 파이프라인에서 가장 흔한 위치 | 쿼리/RAG 파이프라인의 임베딩 Retriever 앞 |
| 필수 초기화 변수 | api_key: OpenAI API 키. OPENAI_API_KEY 환경 변수로도 설정 가능 |
| 필수 실행 변수 | text: 문자열 |
| 출력 변수 | embedding: float 리스트 meta: 메타데이터 딕셔너리 |
| API 레퍼런스 | Embedders |
| GitHub 링크 | https://github.com/deepset-ai/haystack/blob/main/haystack/components/embedders/openai_text_embedder.py |
| 패키지 이름 | haystack-ai |
개요
호환 가능한 OpenAI 임베딩 모델 목록은 OpenAI 문서에서 확인할 수 있어요. OpenAITextEmbedder의 기본 모델은 text-embedding-ada-002이며, 컴포넌트 초기화 시 model 파라미터로 다른 모델을 지정할 수 있어요.
OpenAITextEmbedder는 단일 문자열(예: 쿼리)을 벡터로 임베딩할 때 사용해요. 문서 리스트를 임베딩하려면 OpenAIDocumentEmbedder를 쓰는데, 이 컴포넌트는 문서에 계산된 임베딩(벡터)을 채워 넣어 줘요.
이 컴포넌트는 기본적으로 OPENAI_API_KEY 환경 변수를 사용해요. 원하면 초기화 시 api_key로 직접 넘길 수도 있어요.
embedder = OpenAITextEmbedder(api_key=Secret.from_token("<your-api-key>"))
사용법
단독으로 쓰기
컴포넌트를 단독으로 사용하는 방법은 다음과 같아요.
from haystack.utils import Secret
from haystack.components.embedders import OpenAITextEmbedder
text_to_embed = "I love pizza!"
text_embedder = OpenAITextEmbedder(api_key=Secret.from_token("<your-api-key>"))
print(text_embedder.run(text_to_embed))
# {'embedding': [0.017020374536514282, -0.023255806416273117, ...],
# 'meta': {'model': 'text-embedding-ada-002-v2',
# 'usage': {'prompt_tokens': 4, 'total_tokens': 4}}}
파라미터로 설정하는 대신
OPENAI_API_KEY를 환경 변수로 설정하는 걸 권장해요.
파이프라인 안에서 쓰기
from haystack import Document
from haystack import Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.embedders import OpenAITextEmbedder, OpenAIDocumentEmbedder
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
Document(content="My name is Wolfgang and I live in Berlin"),
Document(content="I saw a black horse running"),
Document(content="Germany has many big cities"),
]
document_embedder = OpenAIDocumentEmbedder()
documents_with_embeddings = document_embedder.run(documents)["documents"]
document_store.write_documents(documents_with_embeddings)
query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", OpenAITextEmbedder())
query_pipeline.add_component(
"retriever",
InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")
query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)