Ministral-3
Ministral-3
Ministral 3 14B는 Ministral 3 계열에서 가장 큰 모델로, 더 큰 Mistral Small 3.2 24B와 견줄 만한 최첨단 성능을 제공해요. 비전 기능을 갖춘 강력하면서도 효율적인 언어 모델이에요. 이 페이지에서는 SGLang에서 Ministral 3을 설치하고, 배포하고, 호출하는 방법과 벤치마크 결과를 단계별로 안내해요.
출처: 문서
본문
1. Model Introduction (모델 소개)
Ministral 3 14B Instruct 모델은 다음과 같은 기능을 제공해요.
- Vision: 텍스트뿐만 아니라 이미지를 분석하고 시각적 내용을 바탕으로 통찰을 제공해요.
- Multilingual: 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 중국어, 일본어, 한국어, 아랍어 등 수십 개 언어를 지원해요.
- System Prompt: 시스템 프롬프트를 강하게 잘 따르고 지원해요.
- Agentic: 네이티브 함수 호출(function calling)과 JSON 출력으로 최고 수준의 에이전트 기능을 제공해요.
- Edge-Optimized: 작은 규모에서도 최고 수준의 성능을 내며 어디서든 배포할 수 있어요.
- Apache 2.0 License: 상업적·비상업적 목적의 사용과 수정을 모두 허용하는 오픈소스 라이선스예요.
- Large Context Window: 256k 컨텍스트 윈도우를 지원해요.
자세한 내용은 공식 문서를 참고해요.
2. SGLang Installation (SGLang 설치)
설치 지침은 공식 SGLang 설치 가이드를 참고해요.
3. Model Deployment (모델 배포)
이 섹션에서는 다양한 하드웨어 플랫폼과 사용 사례에 최적화된 배포 구성을 제공해요.
3.1 Basic Configuration
인터랙티브 명령 생성기(Interactive Command Generator): 아래 설정 선택기를 사용해 하드웨어 플랫폼, 모델 변형, 배포 전략, 사고(thinking) 기능에 맞는 배포 명령을 자동으로 생성할 수 있어요.
3.2 Configuration Tips
컨텍스트 길이와 메모리: Ministral-3은 긴 컨텍스트 윈도우를 광고해요. 메모리가 부족하다면 --context-length(예: 32768)을 낮춰서 시작하고, 안정되면 늘려가요.
도커 실행 후 사전 설치 단계: docker를 실행한 뒤 다음 단계를 추가로 수행해요.
pip install mistral-common --upgrade
pip install transformers==5.0.0.rc0
4. Model Invocation (모델 호출)
4.1 Basic Usage
기본 API 사용법과 요청 예시는 다음 자료를 참고해요.
4.2 Advanced Usage
4.2.1 도커 실행하기
docker pull lmsysorg/sglang:v0.5.9-rocm720-mi30x
docker run -d -it --ipc=host --network=host --privileged \
--cap-add=CAP_SYS_ADMIN \
--device=/dev/kfd --device=/dev/dri --device=/dev/mem \
--group-add video --cap-add=SYS_PTRACE \
--security-opt seccomp=unconfined \
-v /:/work \
-e SHELL=/bin/bash \
--name Ministral \
lmsysorg/sglang:v0.5.9-rocm720-mi30x \
/bin/bash
4.2.2 서버 실행하기
sglang serve \
--model-path mistralai/Ministral-3-14B-Instruct-2512 \
--tp 1 \
--trust-remote-code
5. Benchmark (벤치마크)
이 섹션은 비교 가능한 벤치마크 결과를 위해 업계 표준 구성을 사용해요.
5.1 Speed Benchmark
테스트 환경:
- Hardware: MI300X GPU (8x)
- Model: mistralai/Ministral-3-14B-Instruct-2512
- Tensor Parallelism: 1
- SGLang Version: 0.5.7
- 모델 배포 명령:
sglang serve \
--model-path mistralai/Ministral-3-14B-Instruct-2512 \
--tp 1 \
--trust-remote-code
저동시성(Low Concurrency)
- 벤치마크 명령:
python3 -m sglang.bench_serving \
--backend sglang \
--model mistralai/Ministral-3-14B-Instruct-2512 \
--dataset-name random \
--random-input-len 1000 \
--random-output-len 1000 \
--num-prompts 10 \
--max-concurrency 1 \
--request-rate inf
- 테스트 결과:
============ Serving Benchmark Result ============
Backend: sglang
Traffic request rate: inf
Max request concurrency: 1
Successful requests: 10
Benchmark duration (s): 65.08
Total input tokens: 6101
Total input text tokens: 6101
Total input vision tokens: 0
Total generated tokens: 4220
Total generated tokens (retokenized): 4218
Request throughput (req/s): 0.15
Input token throughput (tok/s): 93.75
Output token throughput (tok/s): 64.84
Peak output token throughput (tok/s): 151.00
Peak concurrent requests: 2
Total token throughput (tok/s): 158.59
Concurrency: 1.00
----------------End-to-End Latency----------------
Mean E2E Latency (ms): 6505.51
Median E2E Latency (ms): 3037.37
---------------Time to First Token----------------
Mean TTFT (ms): 3709.33
Median TTFT (ms): 53.72
P99 TTFT (ms): 33320.77
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms): 6.63
Median TPOT (ms): 6.64
P99 TPOT (ms): 6.66
---------------Inter-Token Latency----------------
Mean ITL (ms): 6.64
Median ITL (ms): 6.65
P95 ITL (ms): 6.75
P99 ITL (ms): 6.82
Max ITL (ms): 8.45
==================================================
중간 동시성(Medium Concurrency)
- 벤치마크 명령:
python3 -m sglang.bench_serving \
--backend sglang \
--model mistralai/Ministral-3-14B-Instruct-2512 \
--dataset-name random \
--random-input-len 1000 \
--random-output-len 1000 \
--num-prompts 80 \
--max-concurrency 16 \
--request-rate inf
- 테스트 결과:
============ Serving Benchmark Result ============
Backend: sglang
Traffic request rate: inf
Max request concurrency: 16
Successful requests: 80
Benchmark duration (s): 31.20
Total input tokens: 39668
Total input text tokens: 39668
Total input vision tokens: 0
Total generated tokens: 40805
Total generated tokens (retokenized): 40783
Request throughput (req/s): 2.56
Input token throughput (tok/s): 1271.38
Output token throughput (tok/s): 1307.82
Peak output token throughput (tok/s): 1760.00
Peak concurrent requests: 22
Total token throughput (tok/s): 2579.20
Concurrency: 13.72
----------------End-to-End Latency----------------
Mean E2E Latency (ms): 5351.07
Median E2E Latency (ms): 5626.45
---------------Time to First Token----------------
Mean TTFT (ms): 280.87
Median TTFT (ms): 68.16
P99 TTFT (ms): 1194.79
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms): 10.47
Median TPOT (ms): 10.10
P99 TPOT (ms): 20.00
---------------Inter-Token Latency----------------
Mean ITL (ms): 9.96
Median ITL (ms): 9.10
P95 ITL (ms): 9.87
P99 ITL (ms): 51.39
Max ITL (ms): 888.63
==================================================
고동시성(High Concurrency)
- 벤치마크 명령:
python3 -m sglang.bench_serving \
--backend sglang \
--model mistralai/Ministral-3-14B-Instruct-2512 \
--dataset-name random \
--random-input-len 1000 \
--random-output-len 1000 \
--num-prompts 500 \
--max-concurrency 100 \
--request-rate inf
- 테스트 결과:
============ Serving Benchmark Result ============
Backend: sglang
Traffic request rate: inf
Max request concurrency: 100
Successful requests: 500
Benchmark duration (s): 88.75
Total input tokens: 249831
Total input text tokens: 249831
Total input vision tokens: 0
Total generated tokens: 252662
Total generated tokens (retokenized): 252547
Request throughput (req/s): 5.63
Input token throughput (tok/s): 2815.01
Output token throughput (tok/s): 2846.91
Peak output token throughput (tok/s): 4271.00
Peak concurrent requests: 110
Total token throughput (tok/s): 5661.93
Concurrency: 93.04
----------------End-to-End Latency----------------
Mean E2E Latency (ms): 16514.45
Median E2E Latency (ms): 15834.45
---------------Time to First Token----------------
Mean TTFT (ms): 148.57
Median TTFT (ms): 99.15
P99 TTFT (ms): 455.86
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms): 32.93
Median TPOT (ms): 34.73
P99 TPOT (ms): 38.05
---------------Inter-Token Latency----------------
Mean ITL (ms): 32.45
Median ITL (ms): 27.30
P95 ITL (ms): 71.73
P99 ITL (ms): 73.45
Max ITL (ms): 328.10
==================================================
5.2 Accuracy Benchmark
표준 벤치마크에서 모델 정확도를 기록해요.
5.2.1 GSM8K Benchmark
- 벤치마크 명령
python3 benchmark/gsm8k/bench_sglang.py \
--num-shots 8 \
--num-questions 1316 \
--parallel 1316
테스트 결과:
Accuracy: 0.959
Invalid: 0.000
Latency: 29.185 s
Output throughput: 4854.672 token/s
더 알아보기 (Learn more)
- SGLang 설치 가이드 — SGLang 설치 방법
- SGLang 기본 사용법 — 기본 API 호출 방법
- SGLang OpenAI Vision API — 비전 모델 API 사용법