Bark 실전 사용 — transformers 파이프라인으로 쓰기

Bark 실전 사용 — transformers 파이프라인

Bark는 Hugging Face Transformers 4.31.0부터 지원돼요. 고수준 text-to-speech 파이프라인으로 몇 줄 만에 추론할 수 있고, 원래 Bark 라이브러리로도 쓸 수 있어요.

출처: https://huggingface.co/suno/bark

설치

pip install --upgrade pip
pip install --upgrade transformers scipy

TTS 파이프라인

from transformers import pipeline
import scipy

synthesiser = pipeline("text-to-speech", "suno/bark")

speech = synthesiser(
    "Hello, my dog is cooler than you!",
    forward_params={"do_sample": True}
)

scipy.io.wavfile.write("bark_out.wav", rate=speech["sampling_rate"], data=speech["audio"])

AutoModel으로 로드

pipeline 대신 AutoProcessor/AutoModel로 직접 다룰 수도 있어요. AutoModelForTextToWaveform은 하위 호환용 별칭이고, AutoModel로 파이프라인에 쓰는 게 표준이에요.

from transformers import AutoProcessor, AutoModel

processor = AutoProcessor.from_pretrained("suno/bark")
model = AutoModel.from_pretrained("suno/bark")

inputs = processor(

Suno 라이브러리로 사용

원래 bark 라이브러리도 그대로 쓸 수 있어요.

from bark import SAMPLE_RATE, generate_audio, preload_models
from IPython.display import Audio

# download and load all models
preload_models()

# generate audio from text
text_prompt = """
     Hello, my name is Suno. And, uh — and I like pizza. [laughs] 
     But I also have other interests such as playing tic tac toe.
"""
speech_array = generate_audio(text_prompt)

# play text in notebook
Audio(speech_array, rate=SAMPLE_RATE)

라이선스·사용 주의

이 모델은 연구용으로만 제공돼요. 출력이 검열되지 않았고, 저자는 생성 콘텐츠의 의견을 지지하지 않아요. 사용 시 그 점을 유의해야 해요.

더 알아보기