Bark 소개 — 텍스트 프롬프트 생성 오디오 모델
Bark 소개
"텍스트를 오디오로" 바꾸는 모델 중에서도 특히 **생성적(generative)**인 방식이 필요할 때가 있어요. Bark는 Suno가 만든 Transformer 기반 텍스트-투-오디오 모델이에요. 높은 현실감의 다중 언어 음성은 물론, 음악·배경 소음·간단한 효과음까지 만들 수 있고, 웃음·한숨·울음 같은 비언어적 의사소통도 생성해요.
핵심 특징
- 여러 언어를 별도 설정 없이 지원하고 입력 텍스트에서 언어를 자동 판단해요. 코드 스위칭(언어 혼용) 텍스트를 주면 언어별 네이티브 억양을 쓰려고 해요. 현재는 영어 품질이 가장 좋아요.
- 지원 언어에 걸쳐 100개 이상의 화자 프리셋을 제공해요.
- 기본
generate_audio는 약 13초 길이의 음성에 잘 맞고, 더 긴 오디오는 long-form 노트북을 참고해요.
설치 주의
pip install bark는 쓰면 안 돼요 — Suno가 관리하지 않는 다른 패키지가 설치돼요. SVG 저장소에서 직접 설치해야 해요.
pip install git+https://github.com/suno-ai/bark.git
기본 사용 (Python)
from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav
from IPython.display import Audio
# download and load all models
preload_models()
# generate audio from text
text_prompt = """
Hello, my name is Suno. And, uh — and I like pizza. [laughs]
But I also have other interests such as playing tic tac toe.
"""
audio_array = generate_audio(text_prompt)
# save audio to disk
write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)
# play text in notebook
Audio(audio_array, rate=SAMPLE_RATE)
하드웨어
풀 버전 Bark는 GPU에 전부 올리려면 약 12GB VRAM이 필요해요. 8GB로 줄이려면 환경 변수 SUNO_USE_SMALL_MODELS=True를 설정하면 돼요.