Bark 실전 사용 — transformers 파이프라인으로 쓰기
Bark 실전 사용 — transformers 파이프라인
Bark는 Hugging Face Transformers 4.31.0부터 지원돼요. 고수준 text-to-speech 파이프라인으로 몇 줄 만에 추론할 수 있고, 원래 Bark 라이브러리로도 쓸 수 있어요.
설치
pip install --upgrade pip
pip install --upgrade transformers scipy
TTS 파이프라인
from transformers import pipeline
import scipy
synthesiser = pipeline("text-to-speech", "suno/bark")
speech = synthesiser(
"Hello, my dog is cooler than you!",
forward_params={"do_sample": True}
)
scipy.io.wavfile.write("bark_out.wav", rate=speech["sampling_rate"], data=speech["audio"])
AutoModel으로 로드
pipeline 대신 AutoProcessor/AutoModel로 직접 다룰 수도 있어요. AutoModelForTextToWaveform은 하위 호환용 별칭이고, AutoModel로 파이프라인에 쓰는 게 표준이에요.
from transformers import AutoProcessor, AutoModel
processor = AutoProcessor.from_pretrained("suno/bark")
model = AutoModel.from_pretrained("suno/bark")
inputs = processor(
Suno 라이브러리로 사용
원래 bark 라이브러리도 그대로 쓸 수 있어요.
from bark import SAMPLE_RATE, generate_audio, preload_models
from IPython.display import Audio
# download and load all models
preload_models()
# generate audio from text
text_prompt = """
Hello, my name is Suno. And, uh — and I like pizza. [laughs]
But I also have other interests such as playing tic tac toe.
"""
speech_array = generate_audio(text_prompt)
# play text in notebook
Audio(speech_array, rate=SAMPLE_RATE)
라이선스·사용 주의
이 모델은 연구용으로만 제공돼요. 출력이 검열되지 않았고, 저자는 생성 콘텐츠의 의견을 지지하지 않아요. 사용 시 그 점을 유의해야 해요.