Wav2Vec2 소개 — 음성만으로 배우는 표현

Wav2Vec2 소개

음성 인식을 "적은 라벨"로 해내기 위한 핵심 질문은, 라벨 없이 음성 그 자체에서 무엇을 배울 수 있느냐예요. Wav2Vec2는 음성 오디오만으로 자기지도 표현을 학습한 뒤, 전사된 음성으로 파인튜닝하면 개념적으로 더 단순하면서도 최고의 준지도 방법을 능가하는 성능을 낸다는 걸 처음으로 보여줬어요.

출처: https://huggingface.co/papers/2006.11477

핵심 아이디어

wav2vec 2.0은 음성 입력을 잠재 공간에서 마스킹하고, 공동으로 학습된 잠재 표현의 양자화를 대상으로 하는 대조 태스크를 풀어요. 피처 인코더가 음성 파형을 잠재 표현으로 바꾸면, Transformer 컨텍스트 네트워크가 전체 시퀀스 정보를 담은 표현을 만들고, 양자화 모듈이 자기지도 목표의 타깃을 만드는 구조예요.

실험 결과

  • Librispeech의 모든 라벨 데이터(960시간)를 쓰면 clean/other 테스트셋에서 1.8/3.3 WER을 달성해요.
  • 라벨을 1시간으로 줄여도 이전 최고 성능(100시간 서브셋 기준)을 뛰어넘으면서 100배 적은 라벨을 사용해요.
  • 라벨 10분 + 비라벨 53k시간 사전학습만으로도 4.8/8.2 WER을 달성해요.

이 결과는 "적은 라벨로도 충분히 좋은 음성 인식이 가능하다"는 점을 보여줘요.

모델 설정 예시

BASE는 12개 Transformer 블록, 모델 차원 768, FFN 내부 차원 3,072, 8개 어텐션 헤드를 사용해요. LARGE는 317m 파라미터로 확장돼요.

더 알아보기