Hugging Face에서 SpeechBrain 사용하기

Hugging Face에서 SpeechBrain 사용하기

speechbrain은 오디오/음성용 오픈소스 올인원 대화형(conversational) 툴킷이에요. 목표는 음성 인식, 화자 인식, 음성 향상, 음성 분리, 언어 식별, 다중 마이크 신호 처리 등 최첨단 음성 기술을 쉽게 개발하는 데 쓸 수 있는 단일하고 유연하며 사용자 친화적인 툴킷을 만드는 것이에요.

Hub에서 speechbrain 모델을 from_hparams로 바로 불러올 수 있어요.

출처: 문서

본문

Hub에서 SpeechBrain 둘러보기

모델 페이지 왼쪽 필터로 speechbrain 모델을 찾을 수 있어요.

Hub의 모든 모델은 다음 기능을 갖추고 있어요:

  1. 간략한 설명이 담긴 자동 생성 모델 카드.
  2. 언어, 라이선스, 논문 등 정보로 발견 가능성을 높이는 메타데이터 태그.
  3. 브라우저에서 모델을 직접 가지고 놀 수 있는 인터랙티브 위젯.
  4. 추론 요청을 할 수 있는 Inference Providers 위젯.

기존 모델 사용하기

speechbrain은 다양한 작업을 위한 사전학습 모델을 관리하는 서로 다른 인터페이스를 제공해요. 예를 들어 EncoderClassifier, EncoderClassifier, SepformerSeparation, SpectralMaskEnhancement가 있어요. 이 클래스들에는 Hub에서 모델을 로드하는 데 사용할 수 있는 from_hparams 메서드가 있어요.

도시 소리에서 소리 인식을 수행하는 추론 예시예요:

import torchaudio
from speechbrain.pretrained import EncoderClassifier

classifier = EncoderClassifier.from_hparams(
    source="speechbrain/urbansound8k_ecapa"
)
out_prob, score, index, text_lab = classifier.classify_file('speechbrain/urbansound8k_ecapa/dog_bark.wav')

특정 모델을 어떻게 로드하는지 보려면 Use in speechbrain을 클릭하면 로드할 수 있는 동작 스니펫을 얻을 수 있어요!

추가 자료

더 알아보기 (Learn more)

  • 음성 인식·화자 인식 등 작업별 사전학습 모델을 from_hparams로 로드해요.
  • source="speechbrain/<model>" 형태로 Hub의 모델을 지정해요.
  • SpeechBrain 문서에서 전체 인터페이스·레시피를 확인해 보세요.