RoBERTa 소개 — 더 나은 사전학습을 향한 재현 연구

RoBERTa 소개

언어 모델 사전학습은 큰 성과를 냈지만, 접근법을 공정하게 비교하기는 어려워요. Facebook AI 연구진은 BERT 사전학습을 재현하며 핵심 하이퍼파라미터와 데이터 크기의 영향을 정밀하게 측정한 결과, BERT가 상당히 덜 학습됐음을 발견했어요. 그렇게 설계를 개선한 모델이 RoBERTa예요.

출처: https://arxiv.org/abs/1907.11692

핵심 발견

  • BERT는 과소 학습(undertrained) 상태였고, 설계를 바로잡으면 이후 등장한 모든 모델 성능과 대등하거나 능가할 수 있었어요.
  • 사전학습 설계 선택이 최종 결과에 결정적 영향을 준다는 점을 다시 확인했어요.

개선된 사전학습 요소

  • 동적 마스킹(dynamic masking) — 마스킹이 매 에포크마다 바뀜
  • 문장 패킹(sentence packing) — 문장 경계를 넘어 연속 시퀀스로 훈련
  • 더 큰 배치(bigger batches)
  • 바이트 레벨 BPE 토크나이저

결과

최고 성능 모델이 GLUE, RACE, SQuAD에서 state-of-the-art를 기록했어요. 모델과 코드도 함께 공개했어요.

더 알아보기