Hugging Face에서 ESPnet 사용하기
Hugging Face에서 ESPnet 사용하기
espnet은 자동 음성 인식(ASR), 텍스트 음성 변환(TTS), 음성 향상, 화자 분리(diarization) 등 다양한 태스크를 위한 엔드투엔드 음성 처리 툴킷이에요.
출처: 문서
본문
허브에서 ESPnet 탐색하기
모델 페이지 왼쪽의 필터를 사용하면 수백 개의 espnet 모델을 찾을 수 있어요.
허브의 모든 모델에는 유용한 기능이 함께 제공됩니다:
- 설명, 학습 구성, 라이선스 등을 담은 자동 생성 모델 카드
- 라이선스, 언어, 데이터셋 같은 정보를 담아 검색 가능성을 돕는 메타데이터 태그
- 브라우저에서 직접 모델을 시험해 볼 수 있는 인터랙티브 위젯
- 추론 요청을 보낼 수 있는 Inference Providers 위젯
기존 모델 사용하기
사전 학습 모델을 로드하는 전체 가이드는 공식 가이드를 확인해 보세요.
추론에 관심이 있다면, 각 태스크의 클래스들이 from_pretrained 메서드를 제공해 허브에서 모델을 로드할 수 있어요. 예를 들어:
- 자동 음성 인식용
Speech2Text - 텍스트 음성 변환용
Text2Speech - 오디오 소스 분리용
SeparateSpeech
다음은 추론 예제예요:
import soundfile
from espnet2.bin.tts_inference import Text2Speech
text2speech = Text2Speech.from_pretrained("model_name")
speech = text2speech("foobar")["wav"]
soundfile.write("out.wav", speech.numpy(), text2speech.fs, "PCM_16")
특정 모델 로드 방법을 보고 싶다면 Use in ESPnet을 클릭하면 로드할 수 있는 동작하는 스니펫을 얻을 수 있어요!
모델 공유하기
ESPnet은 Hugging Face에 쉽게 업로드할 수 있는 zip 파일을 출력해요. 모델 공유의 전체 가이드는 공식 가이드를 확인해 보세요.
run.sh 스크립트는 주어진 모델을 Hugging Face 저장소에 업로드할 수 있게 해 줘요.
./run.sh --stage 15 --skip_upload_hf false --hf_repo username/model_repo
추가 자료
더 알아보기 (Learn more)
- ESPnet model zoo에서 모델 등록과 사용법을 더 배울 수 있어요.
- 허브의
espnet모델 목록을 탐색해 보세요.