CohereDocumentEmbedder
CohereDocumentEmbedder
CohereDocumentEmbedder는 문서의 메타데이터를 해당 내용의 임베딩으로 보강해요. 문자열(예: 쿼리)을 임베딩하려면 CohereTextEmbedder를 사용해야 합니다.
출처: 문서
본문
Overview
이 컴포넌트는 다음 Cohere 모델을 지원합니다:
"embed-v4.0", "embed-english-v3.0", "embed-english-light-v3.0", "embed-multilingual-v3.0",
"embed-multilingual-light-v3.0", "embed-english-v2.0", "embed-english-light-v2.0",
"embed-multilingual-v2.0". 기본 모델은 embed-v4.0이에요. 지원되는 전체 모델 목록은 Cohere 모델 문서에서 찾을 수 있습니다.
Haystack에서 이 통합을 사용하려면 설치하세요:
pip install cohere-haystack
이 컴포넌트는 기본적으로 COHERE_API_KEY 또는 CO_API_KEY 환경 변수를 사용해요. 또는 초기화 시 api_key로 API 키를 넘길 수 있습니다:
from haystack.utils import Secret
from haystack_integrations.components.embedders.cohere import CohereDocumentEmbedder
embedder = CohereDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))
Cohere API 키를 얻으려면 https://cohere.com/ 을 방문하세요.
Embedding Metadata
텍스트 문서에는 종종 메타데이터가 함께 옵니다. 메타데이터가 구별되고 의미적으로 유의미하다면, 문서 텍스트와 함께 임베딩해 검색 성능을 높일 수 있어요.
Document Embedder를 사용하면 됩니다:
from haystack import Document
from haystack.utils import Secret
from haystack_integrations.components.embedders.cohere import CohereDocumentEmbedder
doc = Document(content="some text", meta={"title": "relevant title", "page number": 18})
embedder = CohereDocumentEmbedder(
api_key=Secret.from_token("<your-api-key>"),
meta_fields_to_embed=["title"],
)
docs_w_embeddings = embedder.run(documents=[doc])["documents"]
Usage
On its own
먼저 COHERE_API_KEY를 환경 변수로 설정하거나 직접 전달해야 해요.
from haystack import Document
from haystack_integrations.components.embedders.cohere.document_embedder import (
CohereDocumentEmbedder,
)
doc = Document(content="I love pizza!")
embedder = CohereDocumentEmbedder()
result = embedder.run([doc])
print(result["documents"][0].embedding)
# [-0.453125, 1.2236328, 2.0058594, 0.67871094...]
In a pipeline
from haystack import Document, Pipeline
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack.components.writers import DocumentWriter
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
from haystack_integrations.components.embedders.cohere.document_embedder import (
CohereDocumentEmbedder,
)
from haystack_integrations.components.embedders.cohere.text_embedder import (
CohereTextEmbedder,
)
document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
Document(content="My name is Wolfgang and I live in Berlin"),
Document(content="I saw a black horse running"),
Document(content="Germany has many big cities"),
]
indexing_pipeline = Pipeline()
indexing_pipeline.add_component("embedder", CohereDocumentEmbedder())
indexing_pipeline.add_component("writer", DocumentWriter(document_store=document_store))
indexing_pipeline.connect("embedder", "writer")
indexing_pipeline.run({"embedder": {"documents": documents}})
query_pipeline = Pipeline()
query_pipeline.add_component("text_embedder", CohereTextEmbedder())
query_pipeline.add_component(
"retriever",
InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")
query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)
더 알아보기 (Learn more)
- CohereDocumentEmbedder — Haystack 공식 문서