Parse

Parse (세부 사항 및 응용)

Cohere의 Parse 모델이 어떻게 동작하고 어떻게 사용하는지 설명하는 문서예요. 엔터프라이즈 문서의 비정형(unstructured) 데이터를 AI 지식 애플리케이션에 사용할 수 있는 구조화된 출력으로 변환하는 비전 언어 모델입니다.

출처: 문서

본문

Parse는 엔터프라이즈 문서의 비정형 데이터를 AI 지식 애플리케이션에 사용할 수 있는 구조화된 출력으로 변환하는 비전 언어 모델이에요. 가장 매력적인 가격 대비 성능 옵션 중 하나를 제공해서, 대량의 엔터프라이즈 파싱 워크로드에 이상적인 선택입니다. Parse는 Embed 및 Rerank와 함께 사용해 검색 및 검색 파이프라인을 구축하거나, Compass의 일부로 사용할 수 있어요.

개요(Overview)

  • 최신 모델(Latest model): parse-v5.0
  • 컨텍스트 길이(Context Length): 8192
  • 지원 파일 형식(File types supported): PDF, PPT, JPEG (Base64 인코딩)
  • 출력 형식(Output format): Markdown
  • 파라미터 수(Number of Parameters): 2.3B
  • 모델 크기(Model Size): \~4.6GB
  • 모델 아키텍처(Model Architecture): 독점(Proprietary) north-micro-vision-instruct
  • 엔드포인트(Endpoint): Parse
  • API 레퍼런스(API reference): Parse

추출하는 것(What it extracts)

  • 텍스트와 읽기 순서(reading order)
  • 표(Tables)
  • 목록(Lists)
  • 양식 및 키-값 쌍(Forms and key-value pairs)
  • 이미지와 캡션(Images and captions)
  • 페이지 경계와 시각적 요소의 위치(Locations of page boundaries and visual elements)

출력(Output)

다음을 포함하는 Markdown을 반환해요:

  • 문서 텍스트와 콘텐츠
  • 목록
  • HTML로 표현된 표
  • 경계 상자 좌표(Bounding box coordinates)
  • 이미지 설명
  • 포맷된 Markdown/HTML로 직접 렌더링할 수 있는 콘텐츠

지원 언어(Supported languages)

Parse는 9개 입력 언어에 대해 안정적이에요. 이 모델은 추가 언어에 대한 제로샷(zero-shot) 파싱도 지원하지만, 정확도는 권장 언어보다 낮을 수 있습니다.

ISO 코드(ISO Code) 언어 이름(Language Name)
ar Arabic
en English
fr French
de German
ja Japanese
ko Korean
it Italian
pt Portuguese
es Spanish

가장 적합한 용도(Best for)

Parse는 처리량(throughput), 규모(scale), **비용 효율성(cost effectiveness)**이 핵심 성능 고려 사항인 다음 사용 사례 영역에 특히 잘 맞아요:

  • 검색 및 검색을 위한 문서 준비
  • RAG 수집(ingestion) 파이프라인
  • 지능형 문서 처리(Intelligent document processing)
  • AI 에이전트에 문서 컨텍스트 제공

알려진 한계(Known limitations)

이 모델은 추출된 콘텐츠에 대한 신뢰도 점수(confidence scores)를 반환하지 않아요. 이 모델은 머리말(header), 바닥글(footer), 글꼴 계층 구조 같은 문서 요소를 식별하지 않습니다. 파싱된 콘텐츠는 Markdown으로 반환되며, 구조화된 JSON 출력은 지원되지 않아요.

시작하기(Getting started)

더 알아보기 (Learn more)