지원 모델과 하드웨어

지원 모델과 하드웨어

TEI는 다양한 임베딩 모델 계열을 지원해요. 추론 성능이 우수한 최신 모델들을 배포할 수 있어요.

지원 모델 계열

공식 문서 기준으로 현재 지원하는 임베딩 모델 계열은 다음과 같아요.

  • Nomicnomic-ai/nomic-embed-text-v2-moe (434M) 등
  • BERT 계열 — 절대 위치(absolute positional) 방식의 BERT, CamemBERT, XLM-RoBERTa
  • JinaBERT — Alibi 위치 방식
  • MPNet, ModernBERTanswerdotai/ModernBERT-large (340M) 등
  • Rope 위치 방식 — Mistral, Alibaba GTE(Alibaba-NLP/gte-large-en-v1.5 396M), Qwen2, Qwen3
  • Gemma3

리랭킹과 시퀀스 분류의 경우 CamemBERT, XLM-RoBERTa 시퀀스 분류 모델(절대 위치)을 지원해요.

성능이 우수한 임베딩 모델 목록은 MTEB 리더보드에서도 확인할 수 있어요.

지원 하드웨어

지원 하드웨어는 CPU(x86과 ARM64)와 다음 GPU 세대를 포함해요.

  • Turing/T4/RTX 2000
  • Ampere A100/A30, A10/A40
  • Ada Lovelace RTX 4000
  • Hopper H100
  • Blackwell B200/RTX 5090/DGX Spark

V100 이하(CUDA compute 7.5 미만)는 지원되지 않아요.

모델 선택

서빙할 모델은 text-embeddings-inference 태그가 붙은 Hugging Face 모델(또는 save_pretrained로 저장한 로컬 디렉토리)이면 무엇이든 --model-id로 지정할 수 있어요.

text-embeddings-router --model-id <MODEL_ID>

에어갭(air-gapped) 배포

가중치를 먼저 내려받은 뒤 컨테이너에 볼륨으로 마운트해서, 인터넷이 없는 환경에서도 배포할 수 있어요.

더 알아보기