추론
추론 (Inference)
추론(Inference) 은 머신러닝 모델을 사용해 텍스트, 이미지, 그 외 데이터 타입에서 벡터 임베딩을 만들어 내는 과정이에요. 임베딩을 클라이언트 쪽에서 만들 수도 있지만, Qdrant의 Inference API를 쓰면 서버 쪽에서 임베딩을 생성할 수 있어요. 이때 스파스(sparse), 관리형(managed), 외부 호스팅 모델을 하나로 통일된 단일 API로 다루게 돼요.
추론 옵션 (Inference Options)
어디서 어떻게 임베딩을 생성할지는, 어떤 모델을 쓰고 싶은지, 그리고 임베딩 인프라를 직접 관리하고 싶은지에 따라 달라져요. 선택지별로 흐름을 정리해볼게요.
-
클라이언트 쪽 추론 (Client-side inference): 로컬에서 추론 파이프라인을 직접 관리해요. 예를 들어 Qdrant의 Python FastEmbed 라이브러리를 쓰는 방식이에요. 외부 네트워크 호출 없이 모델과 그 설정을 완전히 제어할 수 있어서, 임베딩 인프라를 직접 관리하고 싶을 때 적합해요.
-
Qdrant 클러스터 (BM25): Qdrant 클러스터 안에서 직접 BM25 모델로 스파스 임베딩을 생성해요. 임베딩 로직이 데이터와 가까이 있게 유지되므로, 키워드 기반 검색을 위해 별도의 추론 서비스를 둘 필요가 없어요.
-
Qdrant Cloud Inference: Qdrant Cloud의 관리형 배포는 Cloud Inference를 쓸 수 있어요. Qdrant Cloud가 다양한 임베딩 모델을 호스팅하고 일부는 무료로 제공해서, 인프라를 관리할 필요 없이 임베딩을 생성할 수 있어요.
-
외부 호스팅 모델 (Qdrant Cloud): 제3자 임베딩 모델 제공업체 (OpenAI, Cohere, Jina AI, OpenRouter) 가 호스팅하는 모델에 접근해요. 별도의 임베딩 파이프라인을 관리할 필요 없이, 통일된 단일 Qdrant API로 다양한 최신 모델을 사용할 수 있어요.
방식 고르기 (Choose Your Approach)
어떤 옵션이 맞을지는 배포 환경과 임베딩할 대상에 따라 달라져요. 이 표를 보고 가장 잘 맞는 방식을 찾아보세요.
| 상황 (If you…) | 사용할 것 (Use…) |
|---|---|
| 스파스 BM25 임베딩이 필요해요 | Qdrant 클러스터 |
| 이미 자체 추론 서비스를 관리하고 있어요 | 클라이언트 쪽 추론 |
| Qdrant를 직접 호스팅해요 | 클라이언트 쪽 추론, 예를 들어 FastEmbed 사용 |
| Qdrant Cloud를 쓰고 지원되는 임베딩 모델 중 하나를 쓰고 싶어요 | Qdrant Cloud Inference |
| Qdrant Cloud를 쓰고 OpenAI, Cohere, Jina AI, OpenRouter 모델을 쓰고 싶어요 | 외부 제공업체를 쓰는 Qdrant Cloud Inference (API 키 필요) |
어떤 방식을 골랐든, 목표는 똑같아요. 데이터를 벡터로 바꾸고 그 벡터로 검색을 수행하는 거죠. 자신의 환경에 맞는 진입점을 골라서 시작하면 돼요.
출처: Qdrant 공식문서