Claude Vision — 이미지와 PDF를 직접 읽는다

Claude Vision — 이미지와 PDF를 직접 읽는다

Anthropic의 Vision 기능은 Claude가 이미지와 PDF를 직접 입력받아 색·레이아웃·문맥을 포함해 이해하게 해줘요. 문서 첨부·스크린샷·다이어그램 같은 것에서 정보를 뽑아낼 수 있어요.

어떤 입력을 받나요

  • 이미지: JPEG·PNG·GIF·WebP. 시각 정보(색, 도형, 배치)까지 이해해요.
  • PDF: 여러 페이지를 변환해 전체 문서를 통합적으로 읽어요.
  • OCR 없이: 텍스트·표·그래프를 렌더링된 형태 그대로 이해해요.

활용 예

  • 스캔 문서·계약서에서 텍스트와 표 추출.
  • 화면·스크린샷을 보고 지침 수행.
  • 이미지 속 다이어그램을 설명하고 코드로 변환.

어떤 모델을 쓰나요

Claude 3.x 이상 모델은 image 콘텐츠 블록을 지원해요. API에서 content 배열에 {"type": "image", "source": {...}}를 넣어 메시지와 함께 전달하면 돼요. 전체 채팅 대화 맥락에서 여러 이미지를 함께 분석하는 것도 가능해요.

더 알아보기