InternVL3-78B (주요 설계)

InternVL3-78B (주요 설계)

InternVL3는 InternVL 시리즈의 고급 멀티모달 LLM 세대예요. 특히 78B 모델이 오픈소스 MLLM 중 인식(perception)과 추론(reasoning) 성능에서 SoTA를 달성했어요.

성능의 핵심은 네 가지 설계에 있어요 — Variable Visual Position Encoding(VVPE), Native Multimodal Pre-Training, Mixed Preference Optimization(MPO), Multimodal Test-Time Scaling이에요. 이 조합이 시각 해상도 유연성과 추론 품질, 정렬을 동시에 잡아줘요.

출처: https://huggingface.co/OpenGVLab/InternVL3-78B

네 가지 핵심 설계

  1. Variable Visual Position Encoding (VVPE) — 이미지 해상도·종횡비에 따라 위치 인코딩을 유연하게 적용. 고해상도 입력에서 디테일을 보존.
  2. Native Multimodal Pre-Training — 텍스트와 비전을 처음부터 통합 사전학습해 모달리티 간 정렬을 끌어올림.
  3. Mixed Preference Optimization (MPO) — 텍스트·비전 혼합 선호 데이터로 정렬, 추론 품질 향상.
  4. Multimodal Test-Time Scaling — 학습 후추론 시점에 계산량을 늘려 어려운 작업의 정확도를 높임.

활용 포인트

  • 사람·환경 인식(perception)과 복잡한 추론(reasoning)을 동시에 요구하는 VQA·Chart QA·에이전트 태스크에 적합.
  • 78B 규모라 단일 고성능 GPU 또는 분산 추론 환경을 전제.

더 알아보기