MongoDBAtlasFullTextRetriever

MongoDBAtlasFullTextRetriever

MongoDB Atlas Document Store와 호환되는 전문(full-text) 검색 Retriever예요.

출처: 문서

본문

MongoDBAtlasFullTextRetriever는 MongoDBAtlasDocumentStore와 호환되는 전문 검색 Retriever예요. 전문 검색은 MongoDBAtlasDocumentStore에서 사용하는 full_text_search_index에 의존해요.

파라미터

MongoDBAtlasFullTextRetriever는 query 외에도 top_k(가져올 최대 문서 수)와 검색 공간을 좁히는 filters 같은 선택 파라미터를 받아요.

컴포넌트를 실행할 때 fuzzy나 synonyms, match_criteria, score 같은 선택 파라미터를 추가로 지정할 수 있어요. 모든 파라미터의 자세한 내용은 MongoDB Atlas API 참조를 확인하세요.

더 알아보기 (Learn more)

설치

MongoDB Atlas를 Haystack에서 쓰려면 패키지를 설치해요.

pip install mongodb-atlas-haystack

단독으로 쓰기

Retriever를 돌리려면 MongoDBAtlasDocumentStore 인스턴스와 인덱싱된 문서가 필요해요.

from haystack_integrations.document_stores.mongodb_atlas import (
    MongoDBAtlasDocumentStore,
)
from haystack_integrations.components.retrievers.mongodb_atlas import (
    MongoDBAtlasFullTextRetriever,
)


store = MongoDBAtlasDocumentStore(
    database_name="your_existing_db",
    collection_name="your_existing_collection",
    vector_search_index="your_existing_index",
    full_text_search_index="your_existing_index",
)

retriever = MongoDBAtlasFullTextRetriever(document_store=store)

results = retriever.run(query="Your search query")
print(results["documents"])

파이프라인에서 쓰기

여기서는 MongoDB Atlas의 두 Retriever를 모두 활용하는 하이브리드 검색 파이프라인 예제를 볼게요.

이 페이지의 예제는 sentence-transformers-haystack 패키지의 Sentence Transformers 임베더를 사용해요. 예제를 실행하려면 설치하세요.

pip install sentence-transformers-haystack
from haystack import Pipeline, Document
from haystack.document_stores.types import DuplicatePolicy
from haystack.components.writers import DocumentWriter
from haystack_integrations.components.embedders.sentence_transformers import (
    SentenceTransformersDocumentEmbedder,
    SentenceTransformersTextEmbedder,
)
from haystack.components.joiners import DocumentJoiner
from haystack_integrations.document_stores.mongodb_atlas import (
    MongoDBAtlasDocumentStore,
)
from haystack_integrations.components.retrievers.mongodb_atlas import (
    MongoDBAtlasEmbeddingRetriever,
    MongoDBAtlasFullTextRetriever,
)


documents = [
    Document(content="My name is Jean and I live in Paris."),
    Document(content="My name is Mark and I live in Berlin."),
    Document(content="My name is Giorgio and I live in Rome."),
    Document(content="Python is a programming language popular for data science."),
    Document(
        content="MongoDB Atlas offers full-text search and vector search capabilities.",
    ),
]

document_store = MongoDBAtlasDocumentStore(
    database_name="haystack_test",
    collection_name="test_collection",
    vector_search_index="test_vector_search_index",
    full_text_search_index="test_full_text_search_index",
)

# Clean out any old data so this example is repeatable
print(f"Clearing collection {document_store.collection_name} …")
document_store.collection.delete_many({})

ingest_pipe = Pipeline()

doc_embedder = SentenceTransformersDocumentEmbedder(model="intfloat/e5-base-v2")
ingest_pipe.add_component(instance=doc_embedder, name="doc_embedder")

doc_writer = DocumentWriter(document_store=document_store, policy=DuplicatePolicy.SKIP)
ingest_pipe.add_component(instance=doc_writer, name="doc_writer")
ingest_pipe.connect("doc_embedder.documents", "doc_writer.documents")

print(f"Running ingestion on {len(documents)} in-memory docs …")
ingest_pipe.run({"doc_embedder": {"documents": documents}})

query_pipe = Pipeline()

text_embedder = SentenceTransformersTextEmbedder(model="intfloat/e5-base-v2")
query_pipe.add_component(instance=text_embedder, name="text_embedder")

embed_retriever = MongoDBAtlasEmbeddingRetriever(document_store=document_store, top_k=3)
query_pipe.add_component(instance=embed_retriever, name="embedding_retriever")
query_pipe.connect("text_embedder", "embedding_retriever")

# (c) full-text retriever
ft_retriever = MongoDBAtlasFullTextRetriever(document_store=document_store, top_k=3)
query_pipe.add_component(instance=ft_retriever, name="full_text_retriever")

joiner = DocumentJoiner(join_mode="reciprocal_rank_fusion", top_k=3)
query_pipe.add_component(instance=joiner, name="joiner")

query_pipe.connect("embedding_retriever", "joiner")
query_pipe.connect("full_text_retriever", "joiner")

question = "Where does Mark live?"
print(f"Running hybrid retrieval for query: '{question}'")
output = query_pipe.run(
    {
        "text_embedder": {"text": question},
        "full_text_retriever": {"query": question},
    },
)

print("\nFinal fused documents:")
for doc in output["joiner"]["documents"]:
    print(f"- {doc.content}")