MongoDBAtlasFullTextRetriever
MongoDBAtlasFullTextRetriever
MongoDB Atlas Document Store와 호환되는 전문(full-text) 검색 Retriever예요.
출처: 문서
본문
MongoDBAtlasFullTextRetriever는 MongoDBAtlasDocumentStore와 호환되는 전문 검색 Retriever예요. 전문 검색은 MongoDBAtlasDocumentStore에서 사용하는 full_text_search_index에 의존해요.
파라미터
MongoDBAtlasFullTextRetriever는 query 외에도 top_k(가져올 최대 문서 수)와 검색 공간을 좁히는 filters 같은 선택 파라미터를 받아요.
컴포넌트를 실행할 때 fuzzy나 synonyms, match_criteria, score 같은 선택 파라미터를 추가로 지정할 수 있어요. 모든 파라미터의 자세한 내용은 MongoDB Atlas API 참조를 확인하세요.
더 알아보기 (Learn more)
설치
MongoDB Atlas를 Haystack에서 쓰려면 패키지를 설치해요.
pip install mongodb-atlas-haystack
단독으로 쓰기
Retriever를 돌리려면 MongoDBAtlasDocumentStore 인스턴스와 인덱싱된 문서가 필요해요.
from haystack_integrations.document_stores.mongodb_atlas import (
MongoDBAtlasDocumentStore,
)
from haystack_integrations.components.retrievers.mongodb_atlas import (
MongoDBAtlasFullTextRetriever,
)
store = MongoDBAtlasDocumentStore(
database_name="your_existing_db",
collection_name="your_existing_collection",
vector_search_index="your_existing_index",
full_text_search_index="your_existing_index",
)
retriever = MongoDBAtlasFullTextRetriever(document_store=store)
results = retriever.run(query="Your search query")
print(results["documents"])
파이프라인에서 쓰기
여기서는 MongoDB Atlas의 두 Retriever를 모두 활용하는 하이브리드 검색 파이프라인 예제를 볼게요.
이 페이지의 예제는 sentence-transformers-haystack 패키지의 Sentence Transformers 임베더를 사용해요. 예제를 실행하려면 설치하세요.
pip install sentence-transformers-haystack
from haystack import Pipeline, Document
from haystack.document_stores.types import DuplicatePolicy
from haystack.components.writers import DocumentWriter
from haystack_integrations.components.embedders.sentence_transformers import (
SentenceTransformersDocumentEmbedder,
SentenceTransformersTextEmbedder,
)
from haystack.components.joiners import DocumentJoiner
from haystack_integrations.document_stores.mongodb_atlas import (
MongoDBAtlasDocumentStore,
)
from haystack_integrations.components.retrievers.mongodb_atlas import (
MongoDBAtlasEmbeddingRetriever,
MongoDBAtlasFullTextRetriever,
)
documents = [
Document(content="My name is Jean and I live in Paris."),
Document(content="My name is Mark and I live in Berlin."),
Document(content="My name is Giorgio and I live in Rome."),
Document(content="Python is a programming language popular for data science."),
Document(
content="MongoDB Atlas offers full-text search and vector search capabilities.",
),
]
document_store = MongoDBAtlasDocumentStore(
database_name="haystack_test",
collection_name="test_collection",
vector_search_index="test_vector_search_index",
full_text_search_index="test_full_text_search_index",
)
# Clean out any old data so this example is repeatable
print(f"Clearing collection {document_store.collection_name} …")
document_store.collection.delete_many({})
ingest_pipe = Pipeline()
doc_embedder = SentenceTransformersDocumentEmbedder(model="intfloat/e5-base-v2")
ingest_pipe.add_component(instance=doc_embedder, name="doc_embedder")
doc_writer = DocumentWriter(document_store=document_store, policy=DuplicatePolicy.SKIP)
ingest_pipe.add_component(instance=doc_writer, name="doc_writer")
ingest_pipe.connect("doc_embedder.documents", "doc_writer.documents")
print(f"Running ingestion on {len(documents)} in-memory docs …")
ingest_pipe.run({"doc_embedder": {"documents": documents}})
query_pipe = Pipeline()
text_embedder = SentenceTransformersTextEmbedder(model="intfloat/e5-base-v2")
query_pipe.add_component(instance=text_embedder, name="text_embedder")
embed_retriever = MongoDBAtlasEmbeddingRetriever(document_store=document_store, top_k=3)
query_pipe.add_component(instance=embed_retriever, name="embedding_retriever")
query_pipe.connect("text_embedder", "embedding_retriever")
# (c) full-text retriever
ft_retriever = MongoDBAtlasFullTextRetriever(document_store=document_store, top_k=3)
query_pipe.add_component(instance=ft_retriever, name="full_text_retriever")
joiner = DocumentJoiner(join_mode="reciprocal_rank_fusion", top_k=3)
query_pipe.add_component(instance=joiner, name="joiner")
query_pipe.connect("embedding_retriever", "joiner")
query_pipe.connect("full_text_retriever", "joiner")
question = "Where does Mark live?"
print(f"Running hybrid retrieval for query: '{question}'")
output = query_pipe.run(
{
"text_embedder": {"text": question},
"full_text_retriever": {"query": question},
},
)
print("\nFinal fused documents:")
for doc in output["joiner"]["documents"]:
print(f"- {doc.content}")