데이터 커넥터
데이터 커넥터 (Data Connectors)
데이터 커넥터(일명 Reader)가 다양한 데이터 소스와 형식의 데이터를 간단한 Document 표현(텍스트와 간단한 메타데이터)으로 수집하는 방법을 알아봐요.
팁: 데이터를 수집한 후에는 그 위에 Index를 만들고, Query Engine으로 질문하고, Chat Engine으로 대화할 수 있어요.
출처: 문서
본문
개념 (Concept)
데이터 커넥터(일명 Reader)는 서로 다른 데이터 소스와 데이터 형식의 데이터를 간단한 Document 표현(텍스트와 간단한 메타데이터)으로 수집해요.
통합 패키지
각 데이터 커넥터는 자체 패키지로 게시되므로 필요한 것만 설치하면 돼요. 전체 세트는 LlamaIndex 저장소의 readers 디렉토리에 있으며, PyPI에서 모든 패키지는 llama-index-readers-<source>로 이름 붙어요.
사용 패턴
다음으로 시작해 보세요:
from llama_index.readers.google import GoogleDocsReader
loader = GoogleDocsReader()
documents = loader.load_data(document_ids=[...])
자세한 내용은 전체 사용 패턴 가이드를 참고하세요.
모듈 (Modules)
몇 가지 데이터 커넥터 예시:
- 로컬 파일 디렉토리 (
SimpleDirectoryReader)..pdf,.jpg,.png,.docx등 광범위한 파일 유형 파싱 지원 - Notion (
NotionPageReader) - Google Docs (
GoogleDocsReader) - Slack (
SlackReader) - Discord (
DiscordReader) - Apify Actors (
ApifyActor). 웹 크롤링, 페이지 스크래핑, 텍스트 콘텐츠 추출,.pdf,.jpg,.png,.docx등 파일 다운로드 가능
자세한 내용은 모듈 가이드를 참고하세요.