Multimodal — 이미지·텍스트를 함께 다루는 LLM 활용

Multimodal

멀티모달은 이미지·텍스트·오디오 등 여러 종류의 입력을 함께 처리하는 AI 모델 활용을 뜻해요. 비전 기반 LLM은 이미지를 이해하고 이에 대해 대화하거나, 이미지 자체를 생성·분석할 수 있어요. 차트 읽기·제품 사진 분석·이미지 캡셔닝 등 실제 업무에 바로 적용되는 영역이에요.

이 카테고리의 문서

  • 개요: 비전 지원 GPT-4 모델과 이미지 이해
  • 핵심 기능: Transformers 이미지 캡셔닝
  • 실전·API: Transformers 파이프라인

출처: https://learn.microsoft.com/en-us/azure/ai-services/openai/how-to/gpt-with-vision