MLX LM으로 Qwen 로컬 실행하기
MLX LM으로 Qwen 로컬 실행하기
mlx-lm은 Apple Silicon에서 LLM을 로컬로 실행할 수 있게 도와주는 라이브러리예요. macOS에서 사용할 수 있고, 이미 Qwen 모델을 지원하며 여기에 바로 쓸 수 있는 체크포인트도 제공해요.
출처: 문서
본문
⚠️ 주의: 이 페이지는 Qwen3 기준으로 업데이트 예정이에요.
mlx-lm은 Apple Silicon에서 LLM을 로컬로 실행하는 데 도움을 주는 도구예요. macOS에서 사용할 수 있고, 이미 Qwen 모델을 지원하며, 이번에는 바로 사용할 수 있는 체크포인트도 함께 제공했어요.
사전 준비
시작하는 가장 쉬운 방법은 mlx-lm 패키지를 설치하는 거예요.
pip로 설치:
pip install mlx-lm
conda로 설치:
conda install -c conda-forge mlx-lm
Qwen MLX 파일로 실행하기
우리는 Hugging Face 조직에서 mlx-lm용 모델 체크포인트를 제공하고 있어요. 필요한 모델을 찾으려면 저장소 이름에서 -MLX를 검색하면 돼요.
apply_chat_template을 사용해 토크나이저와 모델을 불러오고 콘텐츠를 생성하는 방법을 보여주는 코드가 아래에 있어요.
from mlx_lm import load, generate
model, tokenizer = load('Qwen/Qwen2.5-7B-Instruct-MLX', tokenizer_config={"eos_token": "<|im_end|>"})
prompt = "Give me a short introduction to large language models."
messages = [
{"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
response = generate(model, tokenizer, prompt=text, verbose=True, top_p=0.8, temp=0.7, repetition_penalty=1.05, max_tokens=512)
나만의 MLX 파일 만들기
다음 한 줄의 명령만으로 MLX 파일을 만들 수 있어요:
mlx_lm.convert --hf-path Qwen/Qwen2.5-7B-Instruct --mlx-path mlx/Qwen2.5-7B-Instruct/ -q
여기서 각 옵션의 의미는 다음과 같아요:
--hf-path: Hugging Face Hub의 모델 이름 또는 로컬 경로--mlx-path: 출력 파일이 저장될 경로-q: 양자화 활성화