Text Embeddings Inference (TEI)
Text Embeddings Inference (TEI)
Text Embeddings Inference(TEI)는 오픈소스 텍스트 임베딩·시퀀스 분류 모델을 배포하고 서빙하기 위한 툴킷이에요. FlagEmbedding, Ember, GTE, E5 등 가장 인기 있는 임베딩 모델을 고성능으로 추출할 수 있게 해줘요.
Rust 네이티브 스택 위에 토큰 기반 동적 배칭(token-based dynamic batching)과 Flash Attention, Candle 같은 최적화된 transformers 코드를 얹어, 같은 부하에서 10배에 가까운 처리량 개선과 GPU 활용률 상승을 이끌어내요. 그래프 컴파일 단계가 없고, 맥(Mac)에서 돌리는 Metal 지원, 작은 도커 이미지와 빠른 부팅으로 서버리스에도 적합해요.
핵심 개념
/embed— dense 임베딩 생성 (float 벡터 반환)/rerank— 크로스-인코더 리랭킹 (쿼리-문서 쌍에 대한 점수 반환)/predict— 시퀀스 분류 (클래스 확률 반환)/v1/embeddings— OpenAI 호환 래퍼, 기존 RAG 파이프라인에 드롭인
이 카테고리의 문서
- 빠른 시작: Docker 배포와
/embed첫 추론 - API 엔드포인트:
/embed·/rerank·/predict·/v1/embeddings - 지원 모델·하드웨어: 모델 계열과 GPU 요구사항