Falcon2-11B-VLM 모델 카드
Falcon2-11B-VLM 모델 카드
이미지를 "읽고" 설명할 수 있는 비전-언어 모델이 필요하다면 Falcon2-11B-VLM 을 봐요. Falcon2-11B 채팅 모델에 CLIP ViT-L/14 비전 인코더를 결합해, 이미지·텍스트 데이터로 훈련한 VLM 이에요.
구성
- 파라미터: 11B
- 비전 인코더: 사전학습된 CLIP ViT-L/14
- 훈련 데이터: 5,000B+ 토큰 기반 + 이미지-텍스트 데이터
- 장점: 이미지 속 작은 물체의 미세한 디테일 인식을 위한 고해상도 동적 인코딩
시작하기
from transformers import AutoProcessor, LlavaNextForConditionalGeneration
import torch, requests
from PIL import Image
model = LlavaNextForConditionalGeneration.from_pretrained(
"tiiuae/falcon-11B-vlm", torch_dtype=torch.bfloat16
)
processor = AutoProcessor.from_pretrained("tiiuae/falcon-11B-vlm")
이미지 입력에선 User:<image> {instruction} Falcon: 같은 프롬프트 형식을 쓰는 걸 볼 수 있어요.
훈련 과정
- 1단계(사전학습): LLM 은 고정, 멀티모달 프로젝터만 558K 이미지-캡션 쌍으로 학습
- 2단계(파인튜닝): 프로젝터+LLM 을 1.2M 이미지-텍스트 지시 데이터로 학습 (멀티턴 대화 포함)
더 알아보기
- Falcon2-11B LLM: huggingface.co/tiiuae/falcon-11B
- Falcon 2 출시 소식: github.com/huggingface/blog/blob/main/falcon2-11b.md