OracleDocumentStore

OracleDocumentStore

Oracle AI Vector Search(Oracle Database 23ai 이상에서 사용 가능)를 기반으로 한 Document Store예요.

출처: 문서

본문

OracleDocumentStore는 Oracle AI Vector Search를 기반으로 하는 Document Store예요. 문서를 고밀도 벡터 임베딩과 함께 네이티브 VECTOR 컬럼에 저장하고, 자동으로 관리되는 DBMS_SEARCH 인덱스를 통해 벡터 유사도 검색과 키워드 검색을 모두 지원해요.

설치

pip install oracle-haystack

이 페이지의 예제는 sentence-transformers-haystack 패키지로 옮겨간 Sentence Transformers 임베더를 사용해요. 예제를 실행하려면 설치하세요.

pip install sentence-transformers-haystack

연결

OracleDocumentStore는 두 가지 연결 모드를 지원하는 OracleConnectionConfig 데이터클래스로 Oracle에 연결해요.

  • Thin 모드(기본값): TCP로 직접 연결해요. Oracle Instant Client가 필요 없어요.
  • Thick 모드: wallet_location을 제공하면 자동으로 활성화돼요. Oracle Autonomous Database(ADB-S) 연결에 사용해요.

연결 파라미터를 환경 변수로 설정해요.

export ORACLE_USER="haystack"
export ORACLE_PASSWORD="secret"
export ORACLE_DSN="localhost:1521/freepdb1"

초기화

from haystack.utils import Secret
from haystack_integrations.document_stores.oracle import (
    OracleDocumentStore,
    OracleConnectionConfig,
)


document_store = OracleDocumentStore(
    connection_config=OracleConnectionConfig(
        user=Secret.from_env_var("ORACLE_USER"),
        password=Secret.from_env_var("ORACLE_PASSWORD"),
        dsn=Secret.from_env_var("ORACLE_DSN"),
    ),
    embedding_dim=768,
)

초기화 파라미터에 대한 자세한 내용은 API 문서를 확인하세요.

Oracle Autonomous Database에 연결하기

Oracle Autonomous Database(ADB-S)에서는 인증용 wallet을 제공해요. wallet_location을 설정하면 스토어가 자동으로 thick 모드를 활성화해요.

document_store = OracleDocumentStore(
    connection_config=OracleConnectionConfig(
        user=Secret.from_env_var("ORACLE_USER"),
        password=Secret.from_env_var("ORACLE_PASSWORD"),
        dsn=Secret.from_env_var("ORACLE_DSN"),
        wallet_location="/path/to/wallet",
        wallet_password=Secret.from_env_var("WALLET_PASSWORD"),
    ),
    embedding_dim=1536,
)

HNSW 벡터 인덱스

기본적으로 스토어는 정확한 벡터 검색을 수행해요. 근사 최근접 이웃(ANN) 검색(대규모 데이터셋에서 더 빠름)을 하려면 HNSW 인덱스를 만들어요.

document_store = OracleDocumentStore(
    connection_config=OracleConnectionConfig(
        user=Secret.from_env_var("ORACLE_USER"),
        password=Secret.from_env_var("ORACLE_PASSWORD"),
        dsn=Secret.from_env_var("ORACLE_DSN"),
    ),
    embedding_dim=768,
    distance_metric="COSINE",
    create_index=True,  # creates the HNSW index on startup
    hnsw_neighbors=32,
    hnsw_ef_construction=200,
    hnsw_accuracy=95,
)

지원되는 Retriever

  • OracleEmbeddingRetriever: 쿼리 임베딩에 대한 벡터 유사도를 기반으로 OracleDocumentStore에서 문서를 검색해요.
  • OracleKeywordRetriever: Oracle의 DBMS_SEARCH 전문(full-text) 인덱스를 사용해 키워드 쿼리와 일치하는 문서를 검색해요.

예시: RAG 파이프라인

from haystack import Document, Pipeline
from haystack.document_stores.types import DuplicatePolicy
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersDocumentEmbedder,
    SentenceTransformersTextEmbedder,
)
from haystack.components.builders import ChatPromptBuilder
from haystack.components.generators.chat import OpenAIChatGenerator
from haystack.dataclasses import ChatMessage
from haystack.utils import Secret

from haystack_integrations.document_stores.oracle import (
    OracleDocumentStore,
    OracleConnectionConfig,
)
from haystack_integrations.components.retrievers.oracle import OracleEmbeddingRetriever


document_store = OracleDocumentStore(
    connection_config=OracleConnectionConfig(
        user=Secret.from_env_var("ORACLE_USER"),
        password=Secret.from_env_var("ORACLE_PASSWORD"),
        dsn=Secret.from_env_var("ORACLE_DSN"),
    ),
    embedding_dim=384,
)

# Index documents
documents = [
    Document(content="There are over 7,000 languages spoken around the world today."),
    Document(
        content="Elephants have been observed to behave in a way that indicates a high level of self-awareness.",
    ),
    Document(
        content="In certain places, you can witness the phenomenon of bioluminescent waves.",
    ),
]

doc_embedder = SentenceTransformersDocumentEmbedder(
    model="sentence-transformers/all-MiniLM-L6-v2",
)
embedded_docs = doc_embedder.run(documents)["documents"]
document_store.write_documents(embedded_docs, policy=DuplicatePolicy.OVERWRITE)

# Build a RAG pipeline
template = [
    ChatMessage.from_user(
        """
        Given the following context, answer the question.
        Context: {% for doc in documents %}{{ doc.content }}{% endfor %}
        Question: {{ query }}
        """,
    ),
]

pipeline = Pipeline()
pipeline.add_component(
    "embedder",
    SentenceTransformersTextEmbedder(model="sentence-transformers/all-MiniLM-L6-v2"),
)
pipeline.add_component(
    "retriever",
    OracleEmbeddingRetriever(document_store=document_store, top_k=3),
)
pipeline.add_component("prompt_builder", ChatPromptBuilder(template=template))
pipeline.add_component(
    "llm",
    OpenAIChatGenerator(api_key=Secret.from_env_var("OPENAI_API_KEY")),
)

pipeline.connect("embedder.embedding", "retriever.query_embedding")
pipeline.connect("retriever.documents", "prompt_builder.documents")
pipeline.connect("prompt_builder.prompt", "llm.messages")

result = pipeline.run(
    {
        "embedder": {"text": "How many languages are there?"},
        "prompt_builder": {"query": "How many languages are there?"},
    },
)

print(result["llm"]["replies"][0].text)