MLC LLM 퀵스타트 — int4 양자화 Llama3 8B 실행
MLC LLM 퀵스타트 — int4 양자화 Llama3 8B 실행
MLC LLM이 뭔지 빠르게 느끼려면 양자화된 모델 하나를 실제로 돌려보는 게 좋아요. int4 양자화된 Llama3 8B 를 예로 들고, 여유 VRAM 6GB 이상이면 대부분의 지원 환경에서 실행돼요.
MLC LLM은 pip으로 설치할 수 있어요. 격리된 conda 가상환경을 만들어 설치하는 걸 권장해요.
pip install mlc-llm
Python API로 채팅 완료(chat completion)를 실행하는 스크립트는 이래요:
from mlc_llm import MLCEngine
# 엔진 생성
model = "HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC"
engine = MLCEngine(model)
# OpenAI API 형태로 채팅 실행
for response in engine.chat.completions.create(
messages=[{"role": "user", "content": "What is the meaning of life?"}],
model=model,
stream=True,
):
for choice in response.choices:
print(choice.delta.content, end="", flush=True)
print("\n")
engine.terminate()
눈여겨볼 점은 MLCEngine 의 채팅 API가 OpenAI 호환 형태라는 거예요. messages 리스트에 대화를 넣고 model, stream=True 를 지정하면 스트리밍으로 응답이 흘러나와요.
모델은 HuggingFace 경로(여기선 HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC)로 지정해요. 별도로 실행 서버를 띄우지 않아도 Python REST Server, Command Line, Web Browser, iOS, Android 같은 여러 배포 대상으로 이어갈 수 있어요.
참고: 엔진을 다 쓴 뒤엔
engine.terminate()로 정리해야 리소스가 깔끔하게 해제돼요.