OracleDocumentStore
OracleDocumentStore
Oracle AI Vector Search(Oracle Database 23ai 이상에서 사용 가능)를 기반으로 한 Document Store예요.
출처: 문서
본문
OracleDocumentStore는 Oracle AI Vector Search를 기반으로 하는 Document Store예요. 문서를 고밀도 벡터 임베딩과 함께 네이티브 VECTOR 컬럼에 저장하고, 자동으로 관리되는 DBMS_SEARCH 인덱스를 통해 벡터 유사도 검색과 키워드 검색을 모두 지원해요.
설치
pip install oracle-haystack
이 페이지의 예제는 sentence-transformers-haystack 패키지로 옮겨간 Sentence Transformers 임베더를 사용해요. 예제를 실행하려면 설치하세요.
pip install sentence-transformers-haystack
연결
OracleDocumentStore는 두 가지 연결 모드를 지원하는 OracleConnectionConfig 데이터클래스로 Oracle에 연결해요.
- Thin 모드(기본값): TCP로 직접 연결해요. Oracle Instant Client가 필요 없어요.
- Thick 모드:
wallet_location을 제공하면 자동으로 활성화돼요. Oracle Autonomous Database(ADB-S) 연결에 사용해요.
연결 파라미터를 환경 변수로 설정해요.
export ORACLE_USER="haystack"
export ORACLE_PASSWORD="secret"
export ORACLE_DSN="localhost:1521/freepdb1"
초기화
from haystack.utils import Secret
from haystack_integrations.document_stores.oracle import (
OracleDocumentStore,
OracleConnectionConfig,
)
document_store = OracleDocumentStore(
connection_config=OracleConnectionConfig(
user=Secret.from_env_var("ORACLE_USER"),
password=Secret.from_env_var("ORACLE_PASSWORD"),
dsn=Secret.from_env_var("ORACLE_DSN"),
),
embedding_dim=768,
)
초기화 파라미터에 대한 자세한 내용은 API 문서를 확인하세요.
Oracle Autonomous Database에 연결하기
Oracle Autonomous Database(ADB-S)에서는 인증용 wallet을 제공해요. wallet_location을 설정하면 스토어가 자동으로 thick 모드를 활성화해요.
document_store = OracleDocumentStore(
connection_config=OracleConnectionConfig(
user=Secret.from_env_var("ORACLE_USER"),
password=Secret.from_env_var("ORACLE_PASSWORD"),
dsn=Secret.from_env_var("ORACLE_DSN"),
wallet_location="/path/to/wallet",
wallet_password=Secret.from_env_var("WALLET_PASSWORD"),
),
embedding_dim=1536,
)
HNSW 벡터 인덱스
기본적으로 스토어는 정확한 벡터 검색을 수행해요. 근사 최근접 이웃(ANN) 검색(대규모 데이터셋에서 더 빠름)을 하려면 HNSW 인덱스를 만들어요.
document_store = OracleDocumentStore(
connection_config=OracleConnectionConfig(
user=Secret.from_env_var("ORACLE_USER"),
password=Secret.from_env_var("ORACLE_PASSWORD"),
dsn=Secret.from_env_var("ORACLE_DSN"),
),
embedding_dim=768,
distance_metric="COSINE",
create_index=True, # creates the HNSW index on startup
hnsw_neighbors=32,
hnsw_ef_construction=200,
hnsw_accuracy=95,
)
지원되는 Retriever
OracleEmbeddingRetriever: 쿼리 임베딩에 대한 벡터 유사도를 기반으로OracleDocumentStore에서 문서를 검색해요.OracleKeywordRetriever: Oracle의 DBMS_SEARCH 전문(full-text) 인덱스를 사용해 키워드 쿼리와 일치하는 문서를 검색해요.
예시: RAG 파이프라인
from haystack import Document, Pipeline
from haystack.document_stores.types import DuplicatePolicy
from haystack_integrations.components.embedders.sentence_transformers import (
SentenceTransformersDocumentEmbedder,
SentenceTransformersTextEmbedder,
)
from haystack.components.builders import ChatPromptBuilder
from haystack.components.generators.chat import OpenAIChatGenerator
from haystack.dataclasses import ChatMessage
from haystack.utils import Secret
from haystack_integrations.document_stores.oracle import (
OracleDocumentStore,
OracleConnectionConfig,
)
from haystack_integrations.components.retrievers.oracle import OracleEmbeddingRetriever
document_store = OracleDocumentStore(
connection_config=OracleConnectionConfig(
user=Secret.from_env_var("ORACLE_USER"),
password=Secret.from_env_var("ORACLE_PASSWORD"),
dsn=Secret.from_env_var("ORACLE_DSN"),
),
embedding_dim=384,
)
# Index documents
documents = [
Document(content="There are over 7,000 languages spoken around the world today."),
Document(
content="Elephants have been observed to behave in a way that indicates a high level of self-awareness.",
),
Document(
content="In certain places, you can witness the phenomenon of bioluminescent waves.",
),
]
doc_embedder = SentenceTransformersDocumentEmbedder(
model="sentence-transformers/all-MiniLM-L6-v2",
)
embedded_docs = doc_embedder.run(documents)["documents"]
document_store.write_documents(embedded_docs, policy=DuplicatePolicy.OVERWRITE)
# Build a RAG pipeline
template = [
ChatMessage.from_user(
"""
Given the following context, answer the question.
Context: {% for doc in documents %}{{ doc.content }}{% endfor %}
Question: {{ query }}
""",
),
]
pipeline = Pipeline()
pipeline.add_component(
"embedder",
SentenceTransformersTextEmbedder(model="sentence-transformers/all-MiniLM-L6-v2"),
)
pipeline.add_component(
"retriever",
OracleEmbeddingRetriever(document_store=document_store, top_k=3),
)
pipeline.add_component("prompt_builder", ChatPromptBuilder(template=template))
pipeline.add_component(
"llm",
OpenAIChatGenerator(api_key=Secret.from_env_var("OPENAI_API_KEY")),
)
pipeline.connect("embedder.embedding", "retriever.query_embedding")
pipeline.connect("retriever.documents", "prompt_builder.documents")
pipeline.connect("prompt_builder.prompt", "llm.messages")
result = pipeline.run(
{
"embedder": {"text": "How many languages are there?"},
"prompt_builder": {"query": "How many languages are there?"},
},
)
print(result["llm"]["replies"][0].text)