Pinecone 검색 방식 고르기 — 4가지 접근법
Pinecone 검색 방식 고르기 — 4가지 접근법
Pinecone은 네 가지 검색 접근법을 제공하고, 각각 랭킹 신호와 요구되는 인덱스 형태가 달라요. 검색은 읽기 유닛(RU)을 소비하므로 비용 계산에도 이 기준이 쓰입니다.
검색 유형
- 풀텍스트 검색(full-text search) — 질의와 특정 토큰을 공유하는 결과를 BM25로 랭킹하고, Lucene 문법으로 불리언·구문 연산자를 지원해요.
- 의미 검색(semantic search) — 밀집 벡터로 개념(의미 유사도)에 랭킹.
- 스파스 벡터 검색(sparse-vector lexical search) — 토큰을 인식하되 학습된 토큰별 가중치와 용어 확장을 씀.
pinecone-sparse-english-v0같은 스파스 인코더로 만든 표현 기준. - 하이브리드 검색(hybrid search) — 의미와 키워드 신호를 함께 사용.
선택 의사결정 트리
순서대로 물어보면서 처음 매칭되는 방법을 고르면 돼요.
- 질의가 데이터와 특정 토큰을 공유하나요? (제품명·에러 메시지·소스코드·식별자) → 풀텍스트 검색
- 자연어로 의미가 정확한 단어보다 중요한가요? (동의어·의역·개념적 유사) → 의미 검색(밀집 벡터 필드)
- Pinecone 앞단에서 학습된 스파스 벡터 표현을 만드나요? → 스파스 벡터 어휘 검색
- 같은 데이터에 의미와 키워드 신호가 모두 필요하나요?
- JSON 문서 워크로드 → 풀텍스트 검색의 다중 필드 스키마 (
dense_vector+ FTSstring필드) - 벡터 전용 레코드 워크로드 → 하이브리드 검색
- JSON 문서 워크로드 → 풀텍스트 검색의 다중 필드 스키마 (
접근법의 성격
기울기로 보면 밀집은 개념(의미 유사도), 풀텍스트는 엄격한 문자 수준 토큰 매칭(BM25), 스파스 벡터 어휘 검색은 그 사이에 있어요 — 토큰을 인식하되 학습된 토큰별 가중치를 씁니다. 키워드·구문 검색에는 풀텍스트 검색을 권장합니다.
더 알아보기
- 의미 검색은 Semantic search 참고
- 데이터 모델링은 Data modeling 참고
- 빠른 시작은 Quickstart 참고