Jina AI 생태계 — 검색·RAG를 위한 오픈소스 도구들
Jina AI 생태계 — 검색·RAG를 위한 오픈소스 도구들
Jina AI는 검색·생성(RAG) 전반을 아우르는 오픈소스 생태계를 만들어요. 임베딩, 리랭커, Reader(웹→LLM), 스코어링 모델 등 개별 빌딩 블록을 조합해 자신만의 검색 파이프라인을 구축할 수 있습니다.
핵심 구성 요소
- Jina Embeddings: 다국어 문장 임베딩 생성. 5,000개 이상 하드웨어 성능/가격 조합에서 선택 가능하고 100여 개 언어를 지원해요.
- Jina Reader: URL을 LLM이 읽기 좋은 마크다운으로 변환하는 도구. 웹 콘텐츠를 RAG 파이프라인에 바로 넣을 수 있게 해줍니다.
- Jina Reranker: 초기 검색 결과를 질의와의 진짜 관련성에 따라 다시 정렬해 검색 정확도를 높여요.
- Jina ColBERT / Late Chunking: 컬렉션 레벨 임베딩·지연 청킹 전략으로 검색 품질을 더 정밀하게 조정합니다.
RAG 파이프라인 예시
Jina AI의 지향점을 가시화하면 이런 흐름이에요.
- Reader가 웹 문서를 깨끗한 마크다운으로 변환.
- Embeddings가 문서를 벡터로 인코딩해 벡터 DB에 저장.
- 사용자 질의 시 retrieval로 후보 문서를 가져옴.
- Reranker가 후보를 재정렬해 최종 응답 품질을 끌어올림.
API 엔드포인트
모든 도구는 OpenAI 스타일의 https://api.jina.ai/v1/... 엔드포인트로 제공됩니다.
- 임베딩:
POST /v1/embeddings - 리랭크:
POST /v1/rerank - Reader:
https://r.jina.ai/<URL>
curl "https://api.jina.ai/v1/embeddings" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{"model": "jina-embeddings-v3", "input": ["hello world"]}'
오픈소스 라이선스
각 모델·도구는 사용자 정의 라이선스(예: Jina Embeddings v3의 제한된 오픈소스 라이선스)를 따르므로, 상업적 사용 전에 모델 카드의 라이선스를 반드시 확인해요.
더 알아보기
- 임베딩은 Embeddings API 참고
- URL 변환은 Reader API 참고
- 검색 재정렬은 Reranker API 참고