GoogleGenAITextEmbedder
GoogleGenAITextEmbedder
Google AI 임베딩 모델을 사용해 문자열을 의미를 포착하는 벡터로 변환하는 구성 요소예요. 임베딩 검색을 수행할 때 쿼리를 벡터로 변환하는 데 이 컴포넌트를 사용해요. 그러면 임베딩 Retriever가 유사하거나 관련 있는 문서를 찾아요.
출처: 문서
본문
GoogleGenAITextEmbedder는 단순 문자열(예: 쿼리)을 벡터로 임베딩해요. 문서 리스트를 임베딩하려면 계산된 임베딩(일명 벡터)으로 문서를 풍부하게 만드는 GoogleGenAIDocumentEmbedder를 사용하세요. 컴포넌트는 Google AI Embedding 모델을 지원해요. gemini-embedding-001이 기본 모델이에요.
pip install google-genai-haystack
Authentication
Google Gen AI는 Gemini Developer API와 Vertex AI API 모두와 호환돼요. Google AI Studio(Developer API) 또는 Google Cloud > Vertex AI를 참고하세요. 컴포넌트는 기본적으로 GOOGLE_API_KEY 또는 GEMINI_API_KEY 환경 변수를 사용해요. 그렇지 않으면 Secret과 Secret.from_token 정적 메서드로 API 키를 전달할 수 있어요:
embedder = GoogleGenAITextEmbedder(api_key=Secret.from_token("<your-api-key>"))
Gemini Developer API (API Key Authentication)
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAITextEmbedder,
)
# set the environment variable (GOOGLE_API_KEY or GEMINI_API_KEY)
embedder = GoogleGenAITextEmbedder()
Vertex AI (Application Default Credentials)
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAITextEmbedder,
)
# Using Application Default Credentials (requires gcloud auth setup)
embedder = GoogleGenAITextEmbedder(
api="vertex",
vertex_ai_project="my-project",
vertex_ai_location="us-central1",
)
Vertex AI (API Key Authentication)
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAITextEmbedder,
)
# set the environment variable (GOOGLE_API_KEY or GEMINI_API_KEY)
embedder = GoogleGenAITextEmbedder(api="vertex")
- 대표적인 파이프라인 위치: 쿼리/RAG 파이프라인에서 임베딩 Retriever 앞
- 필수 init 변수:
api_key— Google API 키.GOOGLE_API_KEY또는GEMINI_API_KEYenv var로 설정 가능. - 필수 run 변수:
text— 문자열 - 출력 변수:
embedding— float 리스트 /meta— 메타데이터 딕셔너리 - API reference: Google GenAI
- 패키지명:
google-genai-haystack
Usage
On its own
Google API 키를 Secret으로 전달하거나 GOOGLE_API_KEY·GEMINI_API_KEY 환경 변수로 설정해야 해요. 아래 예시는 환경 변수를 설정했다고 전제해요.
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAITextEmbedder,
)
text_to_embed = "I love pizza!"
text_embedder = GoogleGenAITextEmbedder()
print(text_embedder.run(text_to_embed))
# {'embedding': [0.017020374536514282, -0.023255806416273117, ...],
# 'meta': {'model': 'gemini-embedding-001',
# 'usage': {'prompt_tokens': 4, 'total_tokens': 4}}}
In a pipeline
from haystack import Document
from haystack import Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAITextEmbedder,
)
from haystack_integrations.components.embedders.google_genai import (
GoogleGenAIDocumentEmbedder,
)
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
Document(content="My name is Wolfgang and I live in Berlin"),
Document(content="I saw a black horse running"),
Document(content="Germany has many big cities"),
]
document_embedder = GoogleGenAIDocumentEmbedder()
documents_with_embeddings = document_embedder.run(documents)["documents"]
document_store.write_documents(documents_with_embeddings)
query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", GoogleGenAITextEmbedder())
query_pipeline.add_component(
"retriever",
InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")
query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin')