개요 (멀티링궐·태스크 LoRA)

개요 (멀티링궐·태스크 LoRA)

jina-embeddings-v3는 Jina AI가 훈련한 멀티링궐·멀티태스크 텍스트 임베딩 모델이에요. Jina-XLM-RoBERTa 아키텍처 기반에 **Rotary Position Embeddings(RoPE)**를 써서 최대 8192 토큰의 긴 입력을 처리해요.

핵심 특징

  • 긴 시퀀스: RoPE로 최대 8192 토큰 지원
  • 태스크별 임베딩: task 인자를 통해 5가지 LoRA 어댑터 선택
    • retrieval.query — 비대칭 검색의 쿼리
    • retrieval.passage — 비대칭 검색의 패시지
    • separation — 클러스터링·리랭킹용
    • classification — 분류 작업용
    • text-matching — STS·대칭 검색 같은 텍스트 유사도
  • Matryoshka Embeddings: 임베딩 크기를 32, 64, 128, 256, 512, 768, 1024로 자유롭게 잘라 쓸 수 있어요.

언어 지원

파운데이션은 100개 언어를 지원하고, 튜닝은 30개 언어에 집중했어요 (아랍어, 한국어, 일본어, 중국어, 독일어, 프랑스어 등). 한국어도 포함돼 있어요.

풀링 주의

모델을 직접 쓸 땐 mean pooling을 적용해야 해요. 제공되는 encode 함수는 이를 자동 처리해요.

라이선스

AWS·Azure에선 쓸 수 있고, 그 외 자체 배포엔 CC BY-NC 4.0이 적용돼요(상업용은 별도 문의).

더 알아보기