RoBERTa 소개 — 더 나은 사전학습을 향한 재현 연구
RoBERTa 소개
언어 모델 사전학습은 큰 성과를 냈지만, 접근법을 공정하게 비교하기는 어려워요. Facebook AI 연구진은 BERT 사전학습을 재현하며 핵심 하이퍼파라미터와 데이터 크기의 영향을 정밀하게 측정한 결과, BERT가 상당히 덜 학습됐음을 발견했어요. 그렇게 설계를 개선한 모델이 RoBERTa예요.
핵심 발견
- BERT는 과소 학습(undertrained) 상태였고, 설계를 바로잡으면 이후 등장한 모든 모델 성능과 대등하거나 능가할 수 있었어요.
- 사전학습 설계 선택이 최종 결과에 결정적 영향을 준다는 점을 다시 확인했어요.
개선된 사전학습 요소
- 동적 마스킹(dynamic masking) — 마스킹이 매 에포크마다 바뀜
- 문장 패킹(sentence packing) — 문장 경계를 넘어 연속 시퀀스로 훈련
- 더 큰 배치(bigger batches)
- 바이트 레벨 BPE 토크나이저
결과
최고 성능 모델이 GLUE, RACE, SQuAD에서 state-of-the-art를 기록했어요. 모델과 코드도 함께 공개했어요.