인덱스 방법과 검색 설정

인덱스 방법과 검색 설정

청크 모드를 선택한 다음에는, 구조화된 콘텐츠에 대한 인덱스 방법(Index Method) 을 정해야 해요.

인덱스 방법 선택하기

검색 엔진이 사용자 질문에 가장 관련성 높은 결과를 매칭하기 위해 효율적인 인덱싱 알고리즘을 쓰는 것처럼, 여러분이 고른 인덱스 방법은 LLM의 검색 효율과 지식 베이스 콘텐츠에 대한 답변의 정확도를 직접 좌우해요.

지식 베이스는 High-QualityEconomical 두 가지 인덱스 방법을 제공하고, 각각 다른 검색 설정 옵션을 가져요.

High Quality

High-Quality 인덱스 방법으로 만든 지식 베이스는 나중에 Economical로 바꿀 수 없어요.

High-Quality 인덱스 방법은 임베딩 모델(embedding model) 을 사용해 콘텐츠 청크를 벡터 표현으로 변환해요. 이 과정을 임베딩(embedding) 이라고 불러요.

이 벡터를 다차원 공간의 좌표라고 생각해 보면 돼요. 두 점이 가까울수록 의미가 비슷하다는 뜻이에요. 그래서 시스템이 단순한 키워드 일치가 아니라 의미적 유사성(semantic similarity) 기반으로 관련 정보를 찾을 수 있어요.

교차 모달 검색(cross-modal retrieval) — 텍스트와 이미지를 의미적 연관성 기준으로 함께 검색하는 것 — 을 켜고 싶다면 멀티모달 임베딩 모델(Vision 아이콘으로 표시)을 선택하세요. 문서에서 추출한 이미지는 이후 임베딩·인덱싱되어 검색할 수 있게 돼요.

이런 임베딩 모델을 쓰는 지식 베이스는 카드에 Multimodal이라고 표시돼요.

High-Quality 인덱스 방법은 벡터 검색(vector search), 전체 텍스트 검색(full-text search), 하이브리드 검색(hybrid search) 세 가지 검색 전략을 지원해요. 자세한 내용은 아래 '검색 설정 구성하기'에서 볼게요.

Economical

청크당 키워드 10개를 사용해 검색하며, 토큰을 소비하지 않지만 검색 정확도는 떨어져요. 검색된 블록에는 역색인(inverted index) 방법만 제공되어 가장 관련성 높은 블록을 선택해요.

Economical 인덱싱 방법의 성능이 기대에 못 미친다면, Knowledge 설정 페이지에서 High-Quality 인덱싱 방법으로 업그레이드할 수 있어요.

검색 설정 구성하기

지식 베이스가 사용자 질문을 받으면, 미리 설정된 검색 방식에 따라 기존 문서를 검색하고 관련성 높은 콘텐츠 청크를 추출해요. 이 청크들은 LLM의 필수 컨텍스트가 되어 답변의 정확성과 신뢰성에 영향을 줘요.

흔한 검색 방식은 두 가지예요.

  1. 의미 검색(Semantic Retrieval) — 벡터 유사도 기반. 텍스트 청크와 질문을 벡터로 변환하고 유사도 점수로 매칭해요.
  2. 키워드 매칭(Keyword Matching) — 역색인(검색 엔진의 표준 기법) 사용.

Dify 지식 베이스는 두 검색 방식을 모두 지원해요. 구체적으로 어떤 검색 옵션을 쓸 수 있는지는 선택한 인덱스 방법에 따라 달라져요.

High Quality(고품질) 검색 설정

High-Quality 인덱싱 방법에서는 Dify가 벡터 검색 유사도, 전체 텍스트 검색 가중치, 하이브리드(벡터 + 전체 텍스트) 검색의 가중치 조합, 그리고 재순위화(재랭킹, rerank) 전략을 구성할 수 있게 해 줘요.

출처: 공식 문서 - Specify the Index Method and Retrieval Settings

더 알아보기 (Learn more)