llamafile 실행하기

llamafile 실행하기

llamafile의 빠른 시작은 한 줄로 끝나요. 내려받은 .llamafile 파일을 실행하면 브라우저에서 바로 채팅 인터페이스가 열려요.

출처: llamafile README

가장 작은 llamafile은 Qwen3.5-0.8B-Q8_0.llamafile이에요. 이를 예로 들어볼게요. 먼저 파일을 내려받고 실행 권한을 준 뒤 실행해요.

# macOS/Linux/BSD
chmod +x Qwen3.5-0.8B-Q8_0.llamafile
# Run it
./Qwen3.5-0.8B-Q8_0.llamafile

이렇게 실행하면 브라우저가 자동으로 열리면서 채팅 인터페이스가 표시돼요. 브라우저가 안 열리면 직접 http://localhost:8080을 열면 돼요. 채팅이 끝나면 터미널로 돌아가 Control-C를 눌러 llamafile을 종료해요.

작은 모델을 고른 이유는 '대부분의 환경에서 바로 동작할 가장 안전한 선택'이기 때문이에요. 메모리와 GPU가 충분하다면 더 크고 표현력 좋은 모델을 골라 정확도를 높일 수도 있어요.

⚠️ 주의: 이건 가장 간단한 실행 경로고, 실제 배포에서는 모델 파일 다운로드 시 신뢰도와 라이선스를 확인해야 해요.

더 알아보기