Unstructured 개요 — 해결하는 문제와 핵심 기능
Unstructured 개요 — 해결하는 문제와 핵심 기능
AI 앱이 신뢰할 만한 답을 내려면, 입력 데이터가 깨끗하고 잘 구조화돼 있어야 해요. Unstructured는 '지저분한 파일을 넣으면 깨끗한 구조화 JSON이 나온다'를 핵심 모토로 하는 데이터 처리 플랫폼이에요.
해결하는 문제를 정리하면 이래요.
- AI 에이전트용 데이터 확보·강화 — 지저분한 파일을 넣고 깨끗한 구조화 JSON을 얻어요. 구조화된 메타데이터를 더하면 더 나은 결정과 행동에 도움이 돼요. 깨끗한 청크와 올바른 컨텍스트는 에이전트가 더 빠르고 잘 이해하게 해요.
- 프로토타이핑 가속 — 처음부터 프로덕션 준비. 코드 우선 또는 노코드 파이프라인 선택 가능. 소스를 벡터 DB까지 몇 분 만에.
- DIY 파이프라인 대체 — 운영 이동을 빠르게, 엔지니어링 비용·유지보수 제거. 견고한 파티셔닝 로직과 가시성 내장.
- 데이터 사일로 통합 — 35+ 커넥터, 65+ 파일 타입. 일관된 JSON 형식으로 부서·도구 전반의 통합 지식 베이스 구성.
핵심 함수는 다섯 가지예요.
- Partition — 비정형 소스 파일과 반구조화 데이터 레코드를 미리 정의된 표현적 JSON 형식의 구조화 문서 요소와 메타데이터로 변환
- Extract — 원하는 타깃 JSON 스키마를 정의하고, 소스에서 값을 그 스키마 형태로 직접 추출
- Enrich — 이미지 설명, 표 설명, 표-HTML 변환, NER, 생성형 OCR 등 AI 생성 개선을 파티셔닝 출력에 추가
- Chunk — 파티셔닝 출력을 임베딩 모델 크기에 맞고 검색 정밀도에 최적화된 조각으로 재배치
- Embed — 텍스트를 임베딩 모델로 숫자 벡터로 변환. 의미를 담은 벡터를 텍스트와 함께 저장해 벡터 스토어에 로드하고 RAG의 유사도 검색에 활용
더 알아보기
- https://docs.unstructured.io/welcome — Unstructured 소개
- https://docs.unstructured.io/quickstart-api — Python 퀵스타트