Wav2Vec2 — 자기지도 음성 표현 학습

Wav2Vec2

음성 인식(ASR)을 만들 때 가장 큰 병목은 전사된(라벨이 붙은) 데이터가 적다는 점이에요. Wav2Vec2는 라벨 없이 음성 오디오만으로 강력한 표현(representation)을 학습하고, 그 위에 아주 적은 전사 데이터로 파인튜닝하면 기존 준지도 방법을 뛰어넘는 성능을 내는 프레임워크예요. 2020년 Facebook AI(현 Meta FAIR)가 발표한 논문(arXiv:2006.11477)과 함께 공개됐어요. 음성 입력을 잠재 공간에서 마스킹하고, 양자화된 잠재 표현을 대상으로 대조 학습을 푸는 방식이에요.

이 카테고리의 문서

  • 소개: 자기지도 음성 표현 학습의 원리
  • 아키텍처와 설정: Wav2Vec2Config 읽기
  • 실전 사용: 파이프라인과 파인튜닝

출처: https://huggingface.co/papers/2006.11477