Falcon2-11B 기술 보고서
Falcon2-11B 기술 보고서
Falcon2-11B 는 TII 가 만든 11B 파라미터의 인과적 디코더 전용(causal decoder-only) 모델이에요. 이 기술 보고서는 이전 세대 Falcon(7B·40B·180B) 의 성과를 이어받아, 추론 비용을 줄이고 이중언어·멀티모달 생태계를 만드는 데 초점을 맞춘 Falcon 2 를 다뤄요.
모델 특징
- 파라미터: 11B
- 학습 데이터: 5,000B+ 토큰 (RefinedWeb + 큐레이션 코퍼스)
- 아키텍처: 병렬 트랜스포머 블록(MLP 와 self-attention 을 병렬 배치, 블록당 단일 layer norm)
- 이중언어·다국어: 훈련 데이터에 다국어 포함
성능
Open LLM Leaderboard 기준으로 Falcon2-11B 는 Mistral-7B 나 Llama3-8B 보다 좋고, Gemma-7B 와 비슷한 성능을 보여줬어요. 특히 Llama3-8B 는 약 3배 많은 데이터로 훈련된 모델인데, 그걸 능가한다는 게 주목할 만해요.
아키텍처 참고
Falcon2-11B 는 n_layers=60, d_model=4096, n_heads=32, head_dim=128, n_kv=8 처럼 구성돼요. 컨텍스트 길이는 훈련 단계에 따라 2048 → 4096 → 8192 로 늘어나는 4단계 훈련 전략을 거쳤어요.
더 알아보기
- Falcon2-11B-VLM: huggingface.co/tiiuae/falcon-11B-vlm
- Falcon 2 출시 소식: github.com/huggingface/blog/blob/main/falcon2-11b.md