MLC LLM 빠른 시작

MLC LLM 빠른 시작

MLC LLM을 처음 쓸 때 가장 빠르게 결과를 보는 방법은, 인트4(int4) 양자화된 Llama3 8B 모델을 파이썬에서 돌려보는 거예요. VRAM이 6GB 이상이면 권장하고요.

출처: Quick Start

먼저 MLC LLM을 pip으로 설치해요. 항상 격리된 conda 가상환경에 설치하는 걸 권장해요.

파이썬에서 채팅 완성(chat completion)을 실행하는 예시를 볼게요.

from mlc_llm import MLCEngine

# Create engine
model = "HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC"
engine = MLCEngine(model)

# Run chat completion in OpenAI API.
for response in engine.chat.completions.create(
    messages=[{"role": "user", "content": "What is the meaning of life?"}],
    model=model,
    stream=True,
):
    for choice in response.choices:
        print(choice.delta.content, end="", flush=True)
print("
")

engine.terminate()

모델 식별자 HF://mlc-ai/Llama-3-8B-Instruct-q4f16_1-MLC는 Hugging Face에 있는 미리 양자화된 가중치를 가리켜요. MLCEngine을 만들면 이 모델을 내려받아 머신러닝 컴파일로 GPU에 맞게 최적화하고, 실행 가능한 모델 라이브러리를 만든 뒤 채팅 런타임을 띄워요.

눈여겨볼 점은 mlc_llm.MLCEngine의 파이썬 API가 OpenAI API와 정렬돼 있다는 거예요. OpenAI 파이썬 패키지를 쓰던 방식 그대로 동기·비동기 생성을 돌릴 수 있죠. 스트리밍 대신 전체 응답을 받고 싶으면 stream=False로, 동시 비동기 생성을 원하면 AsyncMLCEngine을 쓰면 돼요.

더 알아보기