Multimodal 개요 — 비전 지원 GPT-4와 이미지 활용
Multimodal 개요
비전 지원 GPT-4 모델은 이미지와 텍스트를 함께 입력받아 이해·대화할 수 있어요. 사진에서 내용을 읽고, 차트를 해석하고, 이미지에 대한 질문에 답하는 방식으로 실제 업무에 얹을 수 있어요.
비전 모델의 활용 예
- 차트·표 분석: 스크린샷을 넣고 궁금한 수치를 물어봐요
- 제품 이미지 이해: 사진으로 제품 특징·결함 파악
- 문서·양식 OCR: 이미지 안의 텍스트 추출·요약
- 이미지 기반 QA: "이 그림에서 X가 보이니?" 같은 질문
입력 방식
이미지는 텍스트와 함께 메시지의 이미지 부분(image part)으로 전달돼요. 여러 이미지를 함께 넣어 비교·종합할 수도 있어요.
주의사항
- 이미지 해상도·크기 제한을 지켜야 해요
- 프롬프트에 무엇을 보고 답할지를 명확히 해야 결과가 안정적이에요
- 민감·개인정보 이미지는 전송 전 정책 확인이 필요해요