구조화 데이터 추출하기

구조화 데이터 추출하기

LLM은 대량의 비정형 데이터를 받아서 구조화된 형식으로 돌려주는 데 아주 능숙해요. LlamaIndex는 이걸 쉽게 만들도록 설계돼 있어요.

LlamaIndex를 쓰면 LLM이 자연어를 읽고 이름, 날짜, 주소, 금액처럼 의미상 중요한 세부 정보를 골라내, 원본 형식이 무엇이든 일관된 구조화 형식으로 돌려줄 수 있게 만들 수 있어요. 채팅 로그나 대화록 같은 비정형 원본 자료를 다룰 때 특히 유용하죠.

구조화 데이터가 만들어지면 그 데이터를 데이터베이스로 보내거나, 코드에서 구조화된 출력을 파싱해 워크플로를 자동화할 수 있어요.

출처: 공식문서

전체 튜토리얼

Learn 섹션에 구조화 데이터 추출 전체 튜토리얼이 있어요. 거기서 시작하는 걸 추천해요. 튜토리얼의 기법 중 일부를 보여주는 예시 노트북도 함께 있답니다.

다른 가이드

더 낮은 수준의 모듈까지 포함한 구조화 데이터 추출 전반을 살펴보려면 다음 가이드를 보면 좋아요.

멀티모달 구조화 데이터 추출도 지원해요. 멀티모달 유스 케이스 페이지에서 확인할 수 있어요.

더 알아보기

구조화 추출이 실제로 어떻게 동작하는지 이해하고 싶다면 Pydantic 클래스부터 시작해 보는 걸 추천해요. 'Introduction to Structured Data Extraction' 이해 섹션에서 Pydantic이 어떻게 JSON 스키마로 변환되어 LLM의 출력 지침이 되는지 단계별로 설명할게요.