HuBERT — 마스킹 예측로 배우는 자기지도 음성 표현
HuBERT
음성 인식을 잘하려면 모델이 소리와 언어를 함께 배워야 하는데, 레이블이 없는 음성만 있을 때가 대부분이에요. HuBERT(Hidden-Unit BERT)는 자기지도 학습 방식으로 음성 표현을 배우는 모델로, 오프라인 클러스터링을 통해 정렬된 타깃 레이블을 만들고 BERT 식 예측 손실을 마스킹된 영역에만 적용해요. 이렇게 하면 연속 입력 위에서 음향 모델과 언어 모델을 동시에 학습하도록 강제해요. wav2vec 2.0과 동급 이상의 성능을 내면서도, 10분·1시간·10시간 같은 적은 레이블로 파인튜닝해도 강한 모습을 보여줘요.
이 카테고리의 문서
- 소개: Transformers에서 HuBERT 쓸 준비
- 사전학습 모델:
facebook/hubert-base-ls960살펴보기 - 학습과 디코딩: fairseq에서 사전학습·파인튜닝·디코딩
출처: https://huggingface.co/docs/transformers/model_doc/hubert