MLC LLM 빠른 시작
MLC LLM 빠른 시작
MLC LLM을 처음 쓸 때 가장 빠르게 결과를 보는 방법은, 인트4(int4) 양자화된 Llama3 8B 모델을 파이썬에서 돌려보는 거예요. VRAM이 6GB 이상이면 권장하고요.
출처: Quick Start
먼저 MLC LLM을 pip으로 설치해요. 항상 격리된 conda 가상환경에 설치하는 걸 권장해요.
파이썬에서 채팅 완성(chat completion)을 실행하는 예시를 볼게요.
from mlc_llm import MLCEngine
# Create engine
model = "HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC"
engine = MLCEngine(model)
# Run chat completion in OpenAI API.
for response in engine.chat.completions.create(
messages=[{"role": "user", "content": "What is the meaning of life?"}],
model=model,
stream=True,
):
for choice in response.choices:
print(choice.delta.content, end="", flush=True)
print("
")
engine.terminate()
모델 식별자 HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC는 Hugging Face에 있는 미리 양자화된 가중치를 가리켜요. MLCEngine을 만들면 이 모델을 내려받아 머신러닝 컴파일로 GPU에 맞게 최적화하고, 실행 가능한 모델 라이브러리를 만든 뒤 채팅 런타임을 띄워요.
눈여겨볼 점은 mlc_llm.MLCEngine의 파이썬 API가 OpenAI API와 정렬돼 있다는 거예요. OpenAI 파이썬 패키지를 쓰던 방식 그대로 동기·비동기 생성을 돌릴 수 있죠. 스트리밍 대신 전체 응답을 받고 싶으면 stream=False로, 동시 비동기 생성을 원하면 AsyncMLCEngine을 쓰면 돼요.