Reader API — URL을 LLM 친화적 텍스트로

Reader API — URL을 LLM 친화적 텍스트로

LLM에 웹 정보를 넣는 grounding 작업은 사실 까다로워요. 페이지를 긁어 원시 HTML을 넣는 건 복잡하고 차단도 잘 당하며, HTML에는 마크업·스크립트 같은 불필요한 요소가 가득하죠. Reader API는 URL에서 핵심 콘텐츠만 뽑아 깨끗한 LLM 친화적 텍스트로 변환해줍니다.

출처: https://jina.ai/reader/

사용법은 아주 단순해요. URL 앞에 r.jina.ai를 붙이면 됩니다.

https://r.jina.ai/<URL>

Reader API는 개발자 인프라예요. 검색을 대행하는 소비자 검색엔진이 아니라, 당신이 준 URL만 처리하고 LLM이 쓸 좋은 입력을 만들어줘요. 어떤 URL을 처리할지는 사용자가 정하고 출력 사용에 대한 책임도 사용자에게 있어요.

SERP API로 사용하기

Reader는 SERP(검색 결과 페이지) API로도 쓸 수 있어요. 질의 앞에 https://s.jina.ai/?q= 를 붙이면 웹을 검색해 상위 5개 결과를 URL과 콘텐츠와 함께 깨끗한 LLM 친화적 텍스트로 돌려줍니다. 이렇게 하면 LLM을 최신으로 유지하고 사실성을 높이며 환각을 줄일 수 있어요.

참고로 실제 grounding에서는 원래 질문을 그대로 웹에 검색하지 않아요. 질문을 재작성하거나 멀티홉 질문을 쓰고, 검색 결과를 읽은 뒤 추가 질의를 생성해 정보를 모은 다음 최종 답을 내는 방식이 일반적입니다.

이미지 캡션과 PDF 지원

웹페이지의 이미지는 Reader 안의 비전 언어 모델(VLM)이 자동으로 캡션을 만들어 출력에 이미지 alt 태그로 넣어줘요. 덕분에 다운스트림 LLM이 이미지를 추론·요약 과정에 반영할 힌트를 얻습니다. 이미지에 대한 질문을 하거나 특정 이미지를 골라 더 강력한 VLM에 넘겨 심층 분석할 수도 있어요.

Reader는 PDF도 네이티브로 지원해요. 이미지가 많은 대부분의 PDF와 호환되고 매우 빠릅니다. LLM과 결합하면 ChatPDF나 문서 분석 AI를 금방 만들 수 있어요.

비용

Reader API는 무료로 이용 가능하고 유연한 레이트 리밋과 가격 체계를 제공해요. API 키마다 1,000만 토큰(10M free tokens)이 기본 제공됩니다. 요금은 토큰 사용량 기반이며, 인증 없이 쓰는 경우 레이트 리밋이 가장 낮습니다.

더 알아보기

  • 임베딩은 Embeddings API 참고
  • 리랭킹은 Reranker API 참고
  • 전체 API 가격·레이트 리밋은 Jina AI 문서 참고