모델 변형 (7B·40B·180B·11B·Falcon 3)

모델 변형 (7B·40B·180B·11B·Falcon 3)

Falcon 시리즈는 크기와 용도에 따라 여러 변형이 있어요. 각 모델을 살펴볼게요.

Falcon 7B / 40B

  • Falcon-40B — 400억 파라미터, 1,000B 토큰의 RefinedWeb + 큐레이션 데이터로 훈련, Apache 2.0
  • Falcon-7B — Falcon-40B의 작은 형제 모델. 비용이 적은 환경용

7B·40B는 raw 프리트레인 모델이라 대부분 용도에선 추가 파인튜닝이 필요해요. 채팅 형식으로 지시를 받는 용도라면 Falcon-*-Instruct 변형이 적합해요.

Falcon 180B

  • Falcon-180B — 1,800억 파라미터 causal decoder-only 모델
  • 전체 bfloat16으로 추론하려면 약 8x A100 80GB 또는 이에 준하는 장비가 필요해요
  • Falcon-180B TII 라이선스와 허용 사용 정책(AUP) 적용

Falcon 2-11B

  • Falcon2-11B는 110억 파라미터 모델로, 5,000B+ 토큰의 RefinedWeb + 큐레이션 코퍼스로 훈련됐어요
  • 영어·독일어·스페인어·프랑스어·이탈리아어·포르투갈어·폴란드어·네덜란드어·루마니아어·체코어·스웨덴어 지원

Falcon 3

  • Falcon 3(2024년 12월)는 1B·3B·7B·10B 밀집 트랜스포머 모델로, 14조 토큰으로 훈련되고 32K 컨텍스트를 지원해요
  • Falcon3-10B는 출시 당시 13B 파라미터 이하 오픈 LLM 리더보드에서 1위를 차지했어요
  • 수학 추론(GSM8K 83.0)·코딩(MBPP 73.8) 등 파라미터 클래스 내 경쟁력 있는 성능
  • 1.58-bit, GPTQ, AWQ 양자화를 지원해 노트북·에지 추론에 적합

더 알아보기