MLX LM으로 Qwen 로컬 실행하기

MLX LM으로 Qwen 로컬 실행하기

mlx-lm은 Apple Silicon에서 LLM을 로컬로 실행할 수 있게 도와주는 라이브러리예요. macOS에서 사용할 수 있고, 이미 Qwen 모델을 지원하며 여기에 바로 쓸 수 있는 체크포인트도 제공해요.

출처: 문서

본문

⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.

mlx-lm은 Apple Silicon에서 LLM을 로컬로 실행하는 데 도움을 주는 도구예요. macOS에서 사용할 수 있고, 이미 Qwen 모델을 지원하며, 이번에는 바로 사용할 수 있는 체크포인트도 함께 제공했어요.

사전 준비

시작하는 가장 쉬운 방법은 mlx-lm 패키지를 설치하는 거예요.

pip로 설치:

pip install mlx-lm

conda로 설치:

conda install -c conda-forge mlx-lm

Qwen MLX 파일로 실행하기

우리는 Hugging Face 조직에서 mlx-lm용 모델 체크포인트를 제공하고 있어요. 필요한 모델을 찾으려면 저장소 이름에서 -MLX를 검색하면 돼요.

apply_chat_template을 사용해 토크나이저와 모델을 불러오고 콘텐츠를 생성하는 방법을 보여주는 코드가 아래에 있어요.

from mlx_lm import load, generate

model, tokenizer = load('Qwen/Qwen2.5-7B-Instruct-MLX', tokenizer_config={"eos_token": "<|im_end|>"})

prompt = "Give me a short introduction to large language models."
messages = [
    {"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
    {"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)

response = generate(model, tokenizer, prompt=text, verbose=True, top_p=0.8, temp=0.7, repetition_penalty=1.05, max_tokens=512)

나만의 MLX 파일 만들기

다음 한 줄의 명령만으로 MLX 파일을 만들 수 있어요:

mlx_lm.convert --hf-path Qwen/Qwen2.5-7B-Instruct --mlx-path mlx/Qwen2.5-7B-Instruct/ -q

여기서 각 옵션의 의미는 다음과 같아요:

  • --hf-path: Hugging Face Hub의 모델 이름 또는 로컬 경로
  • --mlx-path: 출력 파일이 저장될 경로
  • -q: 양자화 활성화

더 알아보기 (Learn more)