JinaDocumentEmbedder
JinaDocumentEmbedder
문서 리스트의 임베딩을 계산하고 얻은 벡터를 각 문서의 embedding 필드에 저장하는 구성 요소예요. Jina AI Embeddings 모델을 사용해요. 이 컴포넌트가 계산한 벡터는 문서 컬렉션에 대해 임베딩 검색(embedding retrieval)을 수행하는 데 필요해요. 검색 시점에 쿼리를 나타내는 벡터를 문서의 벡터와 비교해 가장 유사하거나 관련 있는 문서를 찾아요.
출처: 문서
본문
JinaDocumentEmbedder는 문서 메타데이터를 콘텐츠의 임베딩으로 풍부하게 만들어요. 문자열을 임베딩하려면 JinaTextEmbedder를 사용해야 해요. 호환되는 Jina Embeddings 모델 목록은 Jina AI의 웹사이트에서 볼 수 있어요. JinaDocumentEmbedder의 기본 모델은 jina-embeddings-v3이에요.
pip install jina-haystack
컴포넌트는 기본적으로 JINA_API_KEY 환경 변수를 사용해요. 그렇지 않으면 초기화 시점에 api_key로 API 키를 전달할 수 있어요:
embedder = JinaDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))
Jina Embeddings API 키를 얻으려면 https://jina.ai/embeddings/로 가세요.
- 대표적인 파이프라인 위치: 인덱싱 파이프라인에서
DocumentWriter앞 - 필수 init 변수:
api_key— Jina API 키.JINA_API_KEYenv var로 설정 가능. - 필수 run 변수:
documents— 문서 리스트 - 출력 변수:
documents— 임베딩으로 풍부해진 문서 리스트 /meta— 메타데이터 딕셔너리 - API reference: Jina
- 패키지명:
jina-haystack
Embedding Metadata
텍스트 문서는 종종 메타데이터 집합과 함께 제공돼요. 그것이 독특하고 의미론적으로 의미가 있다면 문서 텍스트와 함께 임베딩해 검색을 개선할 수 있어요. Document Embedder로 이렇게 해요:
from haystack import Document
from haystack_integrations.components.embedders.jina import JinaDocumentEmbedder
doc = Document(content="some text", meta={"title": "relevant title", "page number": 18})
embedder = JinaDocumentEmbedder(
api_key=Secret.from_token("<your-api-key>"),
meta_fields_to_embed=["title"],
)
docs_w_embeddings = embedder.run(documents=[doc])["documents"]
Usage
On its own
from haystack import Document
from haystack.utils import Secret
from haystack_integrations.components.embedders.jina import JinaDocumentEmbedder
doc = Document(content="I love pizza!")
document_embedder = JinaDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))
result = document_embedder.run([doc])
print(result["documents"][0].embedding)
# [0.017020374536514282, -0.023255806416273117, ...]
info
JINA_API_KEY를 파라미터로 설정하는 대신 환경 변수로 설정하는 것을 권장해요.
In a pipeline
from haystack import Document, Pipeline
from haystack.utils import Secret
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack_integrations.components.embedders.jina import JinaDocumentEmbedder
from haystack_integrations.components.embedders.jina import JinaTextEmbedder
from haystack.components.writers import DocumentWriter
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever
document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")
documents = [
Document(content="My name is Wolfgang and I live in Berlin"),
Document(content="I saw a black horse running"),
Document(content="Germany has many big cities"),
]
indexing_pipeline = Pipeline()
indexing_pipeline.add_component(
"embedder",
JinaDocumentEmbedder(api_key=Secret.from_token("<your-api-key>")),
)
indexing_pipeline.add_component("writer", DocumentWriter(document_store=document_store))
indexing_pipeline.connect("embedder", "writer")
indexing_pipeline.run({"embedder": {"documents": documents}})
query_pipeline = Pipeline()
query_pipeline.add_component(
"text_embedder",
JinaTextEmbedder(api_key=Secret.from_token("<your-api-key>")),
)
query_pipeline.add_component(
"retriever",
InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")
query = "Who lives in Berlin?"
result = query_pipeline.run({"text_embedder": {"text": query}})
print(result["retriever"]["documents"][0])
# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)
더 알아보기 (Learn more)
🧑🍳 Cookbook: Using the Jina-embeddings-v2-base-en model in a Haystack RAG pipeline for legal document analysis