데이터 커넥터

데이터 커넥터 (Data Connectors)

데이터 커넥터(일명 Reader)가 다양한 데이터 소스와 형식의 데이터를 간단한 Document 표현(텍스트와 간단한 메타데이터)으로 수집하는 방법을 알아봐요.

팁: 데이터를 수집한 후에는 그 위에 Index를 만들고, Query Engine으로 질문하고, Chat Engine으로 대화할 수 있어요.

출처: 문서

본문

개념 (Concept)

데이터 커넥터(일명 Reader)는 서로 다른 데이터 소스와 데이터 형식의 데이터를 간단한 Document 표현(텍스트와 간단한 메타데이터)으로 수집해요.

통합 패키지

각 데이터 커넥터는 자체 패키지로 게시되므로 필요한 것만 설치하면 돼요. 전체 세트는 LlamaIndex 저장소의 readers 디렉토리에 있으며, PyPI에서 모든 패키지는 llama-index-readers-<source>로 이름 붙어요.

사용 패턴

다음으로 시작해 보세요:

from llama_index.readers.google import GoogleDocsReader


loader = GoogleDocsReader()
documents = loader.load_data(document_ids=[...])

자세한 내용은 전체 사용 패턴 가이드를 참고하세요.

모듈 (Modules)

몇 가지 데이터 커넥터 예시:

  • 로컬 파일 디렉토리 (SimpleDirectoryReader). .pdf, .jpg, .png, .docx 등 광범위한 파일 유형 파싱 지원
  • Notion (NotionPageReader)
  • Google Docs (GoogleDocsReader)
  • Slack (SlackReader)
  • Discord (DiscordReader)
  • Apify Actors (ApifyActor). 웹 크롤링, 페이지 스크래핑, 텍스트 콘텐츠 추출, .pdf, .jpg, .png, .docx 등 파일 다운로드 가능

자세한 내용은 모듈 가이드를 참고하세요.

더 알아보기 (Learn more)