JinaTextEmbedder

JinaTextEmbedder

문자열(쿼리 같은 것)을 Jina Embeddings 모델로 벡터로 바꿔주는 컴포넌트예요. 임베딩 검색을 할 때 쿼리를 벡터로 만들고, 그다음 임베딩 Retriever가 비슷하거나 관련 있는 문서를 찾게 돼요.

출처: JinaTextEmbedder

본문

개요

JinaTextEmbedder는 단순한 문자열(예: 쿼리)을 벡터로 임베딩해요. 문서 목록을 임베딩할 때는 문서에 계산된 임베딩(벡터)을 채워 넣는 JinaDocumentEmbedder를 사용해요. 호환되는 Jina Embeddings 모델 목록은 Jina AI의 웹사이트에서 볼 수 있어요. JinaTextEmbedder의 기본 모델은 jina-embeddings-v3예요.

이 통합을 Haystack에서 쓰려면 패키지를 설치해요.

pip install jina-haystack

컴포넌트는 기본적으로 JINA_API_KEY 환경 변수를 사용해요. 아니면 초기화할 때 api_key로 API 키를 넘길 수 있어요.

embedder = JinaTextEmbedder(api_key=Secret.from_token("<your-api-key>"))

Jina Embeddings API 키를 얻으려면 https://jina.ai/embeddings/를 방문하면 돼요.

사용법

컴포넌트를 단독으로 쓰는 방법이에요.

from haystack.utils import Secret
from haystack_integrations.components.embedders.jina import JinaTextEmbedder

text_to_embed = "I love pizza!"

text_embedder = JinaTextEmbedder(api_key=Secret.from_token("<your-api-key>"))

print(text_embedder.run(text_to_embed))

# {'embedding': [0.017020374536514282, -0.023255806416273117, ...],
# 'meta': {'model': 'jina-embeddings-v3',
# 'usage': {'prompt_tokens': 4, 'total_tokens': 4}}}

참고: JINA_API_KEY를 파라미터로 넘기기보다 환경 변수로 설정하는 걸 권장해요.

파이프라인 안에서

from haystack import Document
from haystack import Pipeline
from haystack.utils import Secret
from haystack.document_stores.in_memory import InMemoryDocumentStore
from haystack_integrations.components.embedders.jina import JinaDocumentEmbedder
from haystack_integrations.components.embedders.jina import JinaTextEmbedder
from haystack.components.retrievers.in_memory import InMemoryEmbeddingRetriever

document_store = InMemoryDocumentStore(embedding_similarity_function="cosine")

documents = [
    Document(content="My name is Wolfgang and I live in Berlin"),
    Document(content="I saw a black horse running"),
    Document(content="Germany has many big cities"),
]

document_embedder = JinaDocumentEmbedder(api_key=Secret.from_token("<your-api-key>"))
documents_with_embeddings = document_embedder.run(documents)["documents"]
document_store.write_documents(documents_with_embeddings)

query_pipeline = Pipeline()
query_pipeline.add_component(
    "text_embedder",
    JinaTextEmbedder(api_key=Secret.from_token("<your-api-key>")),
)
query_pipeline.add_component(
    "retriever",
    InMemoryEmbeddingRetriever(document_store=document_store),
)
query_pipeline.connect("text_embedder.embedding", "retriever.query_embedding")

query = "Who lives in Berlin?"

result = query_pipeline.run({"text_embedder": {"text": query}})

print(result["retriever"]["documents"][0])

# Document(id=..., content: 'My name is Wolfgang and I live in Berlin', score: ...)

더 알아보기 (Learn more)