Qdrant 인퍼런스
Qdrant 인퍼런스 (Inference)
Inference는 머신러닝 모델로 텍스트·이미지·기타 데이터 유형에서 벡터 임베딩을 생성하는 과정이에요. 클라이언트에서 직접 임베딩을 만들 수도 있지만, Qdrant의 Inference API를 쓰면 sparse·managed·외부 호스팅 모델을 하나의 통합 API로 서버 측에서 임베딩을 생성할 수 있어요. 이 페이지는 인퍼런스 옵션과 선택 전략을 정리해요.
본문
인퍼런스 옵션은 크게 네 가지로 나눌 수 있어요.
- 클라이언트 측 인퍼런스(Client-side inference): 로컬에서 고유한 인퍼런스 파이프라인을 직접 관리해요. 예를 들어 Qdrant의 Python FastEmbed 라이브러리를 쓸 수 있어요.
- Qdrant 클러스터 (BM25): Qdrant 클러스터 안에서 BM25 모델로 sparse 임베딩을 생성해요. 임베딩 로직을 데이터 가까이 유지해서 키워드 기반 검색을 위한 별도 인퍼런스 서비스가 필요 없어요.
- Qdrant Cloud 인퍼런스: Qdrant Cloud의 managed 배포에서 사용 가능해요. 여러 임베딩 모델(일부는 무료)을 호스팅하므로 인프라를 관리하지 않고 임베딩을 생성할 수 있어요.
- 외부 호스팅 모델 (Qdrant Cloud): OpenAI, Cohere, Jina AI, OpenRouter 같은 제3자 임베딩 모델 제공업체에서 호스팅하는 모델에 접근해요. 별도 임베딩 파이프라인 관리 없이 하나의 통합 Qdrant API로 다양한 최신 모델을 사용해요.
접근 방식 선택
| 상황 | 사용할 것 |
|---|---|
| Sparse BM25 임베딩이 필요할 때 | Qdrant 클러스터 |
| Qdrant를 자체 호스팅할 때 | 클라이언트 측 인퍼런스 (예: FastEmbed) |
| Qdrant Cloud를 쓰고 지원되는 임베딩 모델을 쓰고 싶을 때 | Qdrant Cloud 인퍼런스 |
| Qdrant Cloud에서 OpenAI, Cohere, Jina AI, OpenRouter의 모델을 쓰고 싶을 때 | 외부 제공업체를 사용한 Qdrant Cloud 인퍼런스 (API 키 필요) |