Bark 소개 — 텍스트 프롬프트 생성 오디오 모델

Bark 소개

"텍스트를 오디오로" 바꾸는 모델 중에서도 특히 **생성적(generative)**인 방식이 필요할 때가 있어요. Bark는 Suno가 만든 Transformer 기반 텍스트-투-오디오 모델이에요. 높은 현실감의 다중 언어 음성은 물론, 음악·배경 소음·간단한 효과음까지 만들 수 있고, 웃음·한숨·울음 같은 비언어적 의사소통도 생성해요.

출처: https://github.com/suno-ai/bark

핵심 특징

  • 여러 언어를 별도 설정 없이 지원하고 입력 텍스트에서 언어를 자동 판단해요. 코드 스위칭(언어 혼용) 텍스트를 주면 언어별 네이티브 억양을 쓰려고 해요. 현재는 영어 품질이 가장 좋아요.
  • 지원 언어에 걸쳐 100개 이상의 화자 프리셋을 제공해요.
  • 기본 generate_audio는 약 13초 길이의 음성에 잘 맞고, 더 긴 오디오는 long-form 노트북을 참고해요.

설치 주의

pip install bark쓰면 안 돼요 — Suno가 관리하지 않는 다른 패키지가 설치돼요. SVG 저장소에서 직접 설치해야 해요.

pip install git+https://github.com/suno-ai/bark.git

기본 사용 (Python)

from bark import SAMPLE_RATE, generate_audio, preload_models
from scipy.io.wavfile import write as write_wav
from IPython.display import Audio

# download and load all models
preload_models()

# generate audio from text
text_prompt = """
     Hello, my name is Suno. And, uh — and I like pizza. [laughs] 
     But I also have other interests such as playing tic tac toe.
"""
audio_array = generate_audio(text_prompt)

# save audio to disk
write_wav("bark_generation.wav", SAMPLE_RATE, audio_array)

# play text in notebook
Audio(audio_array, rate=SAMPLE_RATE)

하드웨어

풀 버전 Bark는 GPU에 전부 올리려면 약 12GB VRAM이 필요해요. 8GB로 줄이려면 환경 변수 SUNO_USE_SMALL_MODELS=True를 설정하면 돼요.

더 알아보기