RoBERTa — BERT를 제대로 학습시킨 강건한 사전학습 모델

RoBERTa

BERT가 이미 강력하지만, Facebook AI는 "BERT는 사실 **덜 학습(undertrained)**된 상태"라는 결론을 내리고 사전학습 설계를 전면 재조정했어요. 그 결과가 RoBERTa예요. 동적 마스킹, 문장 패킹, 더 큰 배치, 바이트 레벨 BPE 토크나이저 같은 변화로 BERT 이후 모든 모델과 대등하거나 더 나은 성능을 냈어요. GLUE·RACE·SQuAD에서 최고 성능(state-of-the-art)을 기록했죠.

이 카테고리의 문서

  • 소개: RoBERTa가 왜 만들어졌고 무엇이 달라졌는지
  • 핵심 특징: 동적 마스킹·바이트 BPE 등 사전학습 설계
  • 실전: 파이프라인·분류 모델로 쓰기

출처: https://arxiv.org/abs/1907.11692