지원 모델과 하드웨어
지원 모델과 하드웨어
TEI는 다양한 임베딩 모델 계열을 지원해요. 추론 성능이 우수한 최신 모델들을 배포할 수 있어요.
지원 모델 계열
공식 문서 기준으로 현재 지원하는 임베딩 모델 계열은 다음과 같아요.
- Nomic —
nomic-ai/nomic-embed-text-v2-moe(434M) 등 - BERT 계열 — 절대 위치(absolute positional) 방식의 BERT, CamemBERT, XLM-RoBERTa
- JinaBERT — Alibi 위치 방식
- MPNet, ModernBERT —
answerdotai/ModernBERT-large(340M) 등 - Rope 위치 방식 — Mistral, Alibaba GTE(
Alibaba-NLP/gte-large-en-v1.5396M), Qwen2, Qwen3 - Gemma3
리랭킹과 시퀀스 분류의 경우 CamemBERT, XLM-RoBERTa 시퀀스 분류 모델(절대 위치)을 지원해요.
성능이 우수한 임베딩 모델 목록은 MTEB 리더보드에서도 확인할 수 있어요.
지원 하드웨어
지원 하드웨어는 CPU(x86과 ARM64)와 다음 GPU 세대를 포함해요.
- Turing/T4/RTX 2000
- Ampere A100/A30, A10/A40
- Ada Lovelace RTX 4000
- Hopper H100
- Blackwell B200/RTX 5090/DGX Spark
V100 이하(CUDA compute 7.5 미만)는 지원되지 않아요.
모델 선택
서빙할 모델은 text-embeddings-inference 태그가 붙은 Hugging Face 모델(또는 save_pretrained로 저장한 로컬 디렉토리)이면 무엇이든 --model-id로 지정할 수 있어요.
text-embeddings-router --model-id <MODEL_ID>
에어갭(air-gapped) 배포
가중치를 먼저 내려받은 뒤 컨테이너에 볼륨으로 마운트해서, 인터넷이 없는 환경에서도 배포할 수 있어요.