개요 (Falcon 시리즈와 RefinedWeb)
개요 (Falcon 시리즈와 RefinedWeb)
Falcon은 TII가 만든 causal decoder-only 모델 계열이에요. 가장 큰 Falcon 체크포인트는 1조(1T) 토큰 이상의 텍스트로 훈련됐고, 특히 RefinedWeb 코퍼스에 중점을 뒀어요. 큰 모델은 Apache 2.0 라이선스로 제공돼요.
아키텍처
Falcon 아키텍처는 추론에 최적화되어 있어요. GPT-3 논문 구조를 기반으로 하되 몇 가지 차이가 있어요.
- 회전 위치 임베딩(RoPE) — rotary positional embeddings
- 다중 쿼리 어텐션(MQA) — multi-query attention
- FlashAttention — 효율적인 어텐션 변형 지원
- 병렬 어텐션/MLP — 두 개의 레이어 노름을 가진 병렬 디코더 블록
훈련 데이터
Falcon은 RefinedWeb 코퍼스에 큐레이션된 데이터를 더해 훈련했어요. 예를 들어 Falcon 180B는 RefinedWeb, RefinedWeb-Europe, 고품질 기술 데이터, 코드 데이터, 공개 소스에서 추출한 대화형 데이터를 사용했어요. 컨텍스트 길이는 2048→4096→8192 토큰으로 늘린 뒤, 마지막 단계에서 고품질 데이터로 성능을 끌어올리는 4단계 훈련 전략을 따랐어요.
둔감한 내용·바이어스
웹 규모 데이터로 훈련된 모델이므로 온라인에서 흔히 볼 수 있는 고정관념과 편향을 그대로 담고 있을 수 있어요. 특정 태스크에 쓰기 전 파인튜닝과 적절한 가드레일을 권장해요.