Hugging Face에서 ESPnet 사용하기

Hugging Face에서 ESPnet 사용하기

espnet은 자동 음성 인식(ASR), 텍스트 음성 변환(TTS), 음성 향상, 화자 분리(diarization) 등 다양한 태스크를 위한 엔드투엔드 음성 처리 툴킷이에요.

출처: 문서

본문

허브에서 ESPnet 탐색하기

모델 페이지 왼쪽의 필터를 사용하면 수백 개의 espnet 모델을 찾을 수 있어요.

허브의 모든 모델에는 유용한 기능이 함께 제공됩니다:

  1. 설명, 학습 구성, 라이선스 등을 담은 자동 생성 모델 카드
  2. 라이선스, 언어, 데이터셋 같은 정보를 담아 검색 가능성을 돕는 메타데이터 태그
  3. 브라우저에서 직접 모델을 시험해 볼 수 있는 인터랙티브 위젯
  4. 추론 요청을 보낼 수 있는 Inference Providers 위젯

기존 모델 사용하기

사전 학습 모델을 로드하는 전체 가이드는 공식 가이드를 확인해 보세요.

추론에 관심이 있다면, 각 태스크의 클래스들이 from_pretrained 메서드를 제공해 허브에서 모델을 로드할 수 있어요. 예를 들어:

  • 자동 음성 인식용 Speech2Text
  • 텍스트 음성 변환용 Text2Speech
  • 오디오 소스 분리용 SeparateSpeech

다음은 추론 예제예요:

import soundfile
from espnet2.bin.tts_inference import Text2Speech

text2speech = Text2Speech.from_pretrained("model_name")
speech = text2speech("foobar")["wav"]
soundfile.write("out.wav", speech.numpy(), text2speech.fs, "PCM_16")

특정 모델 로드 방법을 보고 싶다면 Use in ESPnet을 클릭하면 로드할 수 있는 동작하는 스니펫을 얻을 수 있어요!

모델 공유하기

ESPnet은 Hugging Face에 쉽게 업로드할 수 있는 zip 파일을 출력해요. 모델 공유의 전체 가이드는 공식 가이드를 확인해 보세요.

run.sh 스크립트는 주어진 모델을 Hugging Face 저장소에 업로드할 수 있게 해 줘요.

./run.sh --stage 15 --skip_upload_hf false --hf_repo username/model_repo

추가 자료

더 알아보기 (Learn more)