RAGStack 데이터 로딩 — LangChain으로 문서 불러오기

RAGStack 데이터 로딩

RAG 파이프라인의 첫 단계는 데이터를 벡터 스토어에 넣어 검색 가능하게 만드는 거예요. RAGStack은 데이터 로딩을 손수 코딩하는 대신 LangChain의 로더를 활용하라고 안내합니다. 예제는 벡터 활성화된 Astra DB Serverless 데이터베이스를 가정해요.

출처: https://docs.datastax.com/en/ragstack/default-architecture/loading.html

로딩 방법

  • PDF: LangChain PDFLoader로 파일에서 로드
  • HTML: LangChain HTMLLoader로 문서 로드
  • S3: LangChain S3 로더로 AWS S3 파일 버킷의 Document 객체 로드
  • Google Cloud Storage: GCS 파일 로더로 GCS 객체 로드

LangChain이 이미 필요한 기능을 제공하므로, 자신의 데이터 소스에 맞는 로더를 골라 쓰면 됩니다.

다음 단계

문서를 로드한 뒤에는 이를 작은 청크로 나누는 스플리팅과 임베딩 단계로 이어져요. RAG 파이프라인은 검색된 청크를 LLM이 응답을 생성할 때 컨텍스트로 사용합니다.

더 알아보기