Parse
Parse (세부 사항 및 응용)
Cohere의 Parse 모델이 어떻게 동작하고 어떻게 사용하는지 설명하는 문서예요. 엔터프라이즈 문서의 비정형(unstructured) 데이터를 AI 지식 애플리케이션에 사용할 수 있는 구조화된 출력으로 변환하는 비전 언어 모델입니다.
출처: 문서
본문
Parse는 엔터프라이즈 문서의 비정형 데이터를 AI 지식 애플리케이션에 사용할 수 있는 구조화된 출력으로 변환하는 비전 언어 모델이에요. 가장 매력적인 가격 대비 성능 옵션 중 하나를 제공해서, 대량의 엔터프라이즈 파싱 워크로드에 이상적인 선택입니다. Parse는 Embed 및 Rerank와 함께 사용해 검색 및 검색 파이프라인을 구축하거나, Compass의 일부로 사용할 수 있어요.
개요(Overview)
- 최신 모델(Latest model):
parse-v5.0 - 컨텍스트 길이(Context Length): 8192
- 지원 파일 형식(File types supported): PDF, PPT, JPEG (Base64 인코딩)
- 출력 형식(Output format): Markdown
- 파라미터 수(Number of Parameters): 2.3B
- 모델 크기(Model Size): \~4.6GB
- 모델 아키텍처(Model Architecture): 독점(Proprietary) north-micro-vision-instruct
- 엔드포인트(Endpoint): Parse
- API 레퍼런스(API reference): Parse
추출하는 것(What it extracts)
- 텍스트와 읽기 순서(reading order)
- 표(Tables)
- 목록(Lists)
- 양식 및 키-값 쌍(Forms and key-value pairs)
- 이미지와 캡션(Images and captions)
- 페이지 경계와 시각적 요소의 위치(Locations of page boundaries and visual elements)
출력(Output)
다음을 포함하는 Markdown을 반환해요:
- 문서 텍스트와 콘텐츠
- 목록
- HTML로 표현된 표
- 경계 상자 좌표(Bounding box coordinates)
- 이미지 설명
- 포맷된 Markdown/HTML로 직접 렌더링할 수 있는 콘텐츠
지원 언어(Supported languages)
Parse는 9개 입력 언어에 대해 안정적이에요. 이 모델은 추가 언어에 대한 제로샷(zero-shot) 파싱도 지원하지만, 정확도는 권장 언어보다 낮을 수 있습니다.
| ISO 코드(ISO Code) | 언어 이름(Language Name) |
|---|---|
| ar | Arabic |
| en | English |
| fr | French |
| de | German |
| ja | Japanese |
| ko | Korean |
| it | Italian |
| pt | Portuguese |
| es | Spanish |
가장 적합한 용도(Best for)
Parse는 처리량(throughput), 규모(scale), **비용 효율성(cost effectiveness)**이 핵심 성능 고려 사항인 다음 사용 사례 영역에 특히 잘 맞아요:
- 검색 및 검색을 위한 문서 준비
- RAG 수집(ingestion) 파이프라인
- 지능형 문서 처리(Intelligent document processing)
- AI 에이전트에 문서 컨텍스트 제공
알려진 한계(Known limitations)
이 모델은 추출된 콘텐츠에 대한 신뢰도 점수(confidence scores)를 반환하지 않아요. 이 모델은 머리말(header), 바닥글(footer), 글꼴 계층 구조 같은 문서 요소를 식별하지 않습니다. 파싱된 콘텐츠는 Markdown으로 반환되며, 구조화된 JSON 출력은 지원되지 않아요.
시작하기(Getting started)
- 레퍼런스 API 읽기
- Parse 퀵스타트 가이드
- Hugging Face Space에서 Parse를 무료로 사용해 보기
- Model Vault를 통해 Parse 접근
- SageMaker 노트북