Ministral-3

Ministral-3

Ministral 3 14B는 Ministral 3 계열에서 가장 큰 모델로, 더 큰 Mistral Small 3.2 24B와 견줄 만한 최첨단 성능을 제공해요. 비전 기능을 갖춘 강력하면서도 효율적인 언어 모델이에요. 이 페이지에서는 SGLang에서 Ministral 3을 설치하고, 배포하고, 호출하는 방법과 벤치마크 결과를 단계별로 안내해요.

출처: 문서

본문

1. Model Introduction (모델 소개)

Ministral 3 14B Instruct 모델은 다음과 같은 기능을 제공해요.

  • Vision: 텍스트뿐만 아니라 이미지를 분석하고 시각적 내용을 바탕으로 통찰을 제공해요.
  • Multilingual: 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 중국어, 일본어, 한국어, 아랍어 등 수십 개 언어를 지원해요.
  • System Prompt: 시스템 프롬프트를 강하게 잘 따르고 지원해요.
  • Agentic: 네이티브 함수 호출(function calling)과 JSON 출력으로 최고 수준의 에이전트 기능을 제공해요.
  • Edge-Optimized: 작은 규모에서도 최고 수준의 성능을 내며 어디서든 배포할 수 있어요.
  • Apache 2.0 License: 상업적·비상업적 목적의 사용과 수정을 모두 허용하는 오픈소스 라이선스예요.
  • Large Context Window: 256k 컨텍스트 윈도우를 지원해요.

자세한 내용은 공식 문서를 참고해요.

2. SGLang Installation (SGLang 설치)

설치 지침은 공식 SGLang 설치 가이드를 참고해요.

3. Model Deployment (모델 배포)

이 섹션에서는 다양한 하드웨어 플랫폼과 사용 사례에 최적화된 배포 구성을 제공해요.

3.1 Basic Configuration

인터랙티브 명령 생성기(Interactive Command Generator): 아래 설정 선택기를 사용해 하드웨어 플랫폼, 모델 변형, 배포 전략, 사고(thinking) 기능에 맞는 배포 명령을 자동으로 생성할 수 있어요.

3.2 Configuration Tips

컨텍스트 길이와 메모리: Ministral-3은 긴 컨텍스트 윈도우를 광고해요. 메모리가 부족하다면 --context-length(예: 32768)을 낮춰서 시작하고, 안정되면 늘려가요.

도커 실행 후 사전 설치 단계: docker를 실행한 뒤 다음 단계를 추가로 수행해요.

pip install mistral-common --upgrade
pip install transformers==5.0.0.rc0

4. Model Invocation (모델 호출)

4.1 Basic Usage

기본 API 사용법과 요청 예시는 다음 자료를 참고해요.

4.2 Advanced Usage

4.2.1 도커 실행하기

docker pull lmsysorg/sglang:v0.5.9-rocm720-mi30x
docker run -d -it --ipc=host --network=host --privileged \
  --cap-add=CAP_SYS_ADMIN \
  --device=/dev/kfd --device=/dev/dri --device=/dev/mem \
  --group-add video --cap-add=SYS_PTRACE \
  --security-opt seccomp=unconfined \
  -v /:/work \
  -e SHELL=/bin/bash \
  --name Ministral \
 lmsysorg/sglang:v0.5.9-rocm720-mi30x \
  /bin/bash

4.2.2 서버 실행하기

sglang serve \
  --model-path mistralai/Ministral-3-14B-Instruct-2512 \
  --tp 1 \
  --trust-remote-code

5. Benchmark (벤치마크)

이 섹션은 비교 가능한 벤치마크 결과를 위해 업계 표준 구성을 사용해요.

5.1 Speed Benchmark

테스트 환경:

  • Hardware: MI300X GPU (8x)
  • Model: mistralai/Ministral-3-14B-Instruct-2512
  • Tensor Parallelism: 1
  • SGLang Version: 0.5.7
  • 모델 배포 명령:
sglang serve \
  --model-path mistralai/Ministral-3-14B-Instruct-2512 \
  --tp 1 \
  --trust-remote-code
저동시성(Low Concurrency)
  • 벤치마크 명령:
python3 -m sglang.bench_serving \
  --backend sglang \
  --model mistralai/Ministral-3-14B-Instruct-2512 \
  --dataset-name random \
  --random-input-len 1000 \
  --random-output-len 1000 \
  --num-prompts 10 \
  --max-concurrency 1 \
  --request-rate inf
  • 테스트 결과:
============ Serving Benchmark Result ============
Backend:                                 sglang
Traffic request rate:                    inf
Max request concurrency:                 1
Successful requests:                     10
Benchmark duration (s):                  65.08
Total input tokens:                      6101
Total input text tokens:                 6101
Total input vision tokens:               0
Total generated tokens:                  4220
Total generated tokens (retokenized):    4218
Request throughput (req/s):              0.15
Input token throughput (tok/s):          93.75
Output token throughput (tok/s):         64.84
Peak output token throughput (tok/s):    151.00
Peak concurrent requests:                2
Total token throughput (tok/s):          158.59
Concurrency:                             1.00
----------------End-to-End Latency----------------
Mean E2E Latency (ms):                   6505.51
Median E2E Latency (ms):                 3037.37
---------------Time to First Token----------------
Mean TTFT (ms):                          3709.33
Median TTFT (ms):                        53.72
P99 TTFT (ms):                           33320.77
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms):                          6.63
Median TPOT (ms):                        6.64
P99 TPOT (ms):                           6.66
---------------Inter-Token Latency----------------
Mean ITL (ms):                           6.64
Median ITL (ms):                         6.65
P95 ITL (ms):                            6.75
P99 ITL (ms):                            6.82
Max ITL (ms):                            8.45
==================================================
중간 동시성(Medium Concurrency)
  • 벤치마크 명령:
python3 -m sglang.bench_serving \
  --backend sglang \
  --model mistralai/Ministral-3-14B-Instruct-2512 \
  --dataset-name random \
  --random-input-len 1000 \
  --random-output-len 1000 \
  --num-prompts 80 \
  --max-concurrency 16 \
  --request-rate inf
  • 테스트 결과:
============ Serving Benchmark Result ============
Backend:                                 sglang
Traffic request rate:                    inf
Max request concurrency:                 16
Successful requests:                     80
Benchmark duration (s):                  31.20
Total input tokens:                      39668
Total input text tokens:                 39668
Total input vision tokens:               0
Total generated tokens:                  40805
Total generated tokens (retokenized):    40783
Request throughput (req/s):              2.56
Input token throughput (tok/s):          1271.38
Output token throughput (tok/s):         1307.82
Peak output token throughput (tok/s):    1760.00
Peak concurrent requests:                22
Total token throughput (tok/s):          2579.20
Concurrency:                             13.72
----------------End-to-End Latency----------------
Mean E2E Latency (ms):                   5351.07
Median E2E Latency (ms):                 5626.45
---------------Time to First Token----------------
Mean TTFT (ms):                          280.87
Median TTFT (ms):                        68.16
P99 TTFT (ms):                           1194.79
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms):                          10.47
Median TPOT (ms):                        10.10
P99 TPOT (ms):                           20.00
---------------Inter-Token Latency----------------
Mean ITL (ms):                           9.96
Median ITL (ms):                         9.10
P95 ITL (ms):                            9.87
P99 ITL (ms):                            51.39
Max ITL (ms):                            888.63
==================================================
고동시성(High Concurrency)
  • 벤치마크 명령:
python3 -m sglang.bench_serving \
  --backend sglang \
  --model mistralai/Ministral-3-14B-Instruct-2512 \
  --dataset-name random \
  --random-input-len 1000 \
  --random-output-len 1000 \
  --num-prompts 500 \
  --max-concurrency 100 \
  --request-rate inf
  • 테스트 결과:
============ Serving Benchmark Result ============
Backend:                                 sglang
Traffic request rate:                    inf
Max request concurrency:                 100
Successful requests:                     500
Benchmark duration (s):                  88.75
Total input tokens:                      249831
Total input text tokens:                 249831
Total input vision tokens:               0
Total generated tokens:                  252662
Total generated tokens (retokenized):    252547
Request throughput (req/s):              5.63
Input token throughput (tok/s):          2815.01
Output token throughput (tok/s):         2846.91
Peak output token throughput (tok/s):    4271.00
Peak concurrent requests:                110
Total token throughput (tok/s):          5661.93
Concurrency:                             93.04
----------------End-to-End Latency----------------
Mean E2E Latency (ms):                   16514.45
Median E2E Latency (ms):                 15834.45
---------------Time to First Token----------------
Mean TTFT (ms):                          148.57
Median TTFT (ms):                        99.15
P99 TTFT (ms):                           455.86
-----Time per Output Token (excl. 1st token)------
Mean TPOT (ms):                          32.93
Median TPOT (ms):                        34.73
P99 TPOT (ms):                           38.05
---------------Inter-Token Latency----------------
Mean ITL (ms):                           32.45
Median ITL (ms):                         27.30
P95 ITL (ms):                            71.73
P99 ITL (ms):                            73.45
Max ITL (ms):                            328.10
==================================================

5.2 Accuracy Benchmark

표준 벤치마크에서 모델 정확도를 기록해요.

5.2.1 GSM8K Benchmark

  • 벤치마크 명령
python3 benchmark/gsm8k/bench_sglang.py \
  --num-shots 8 \
  --num-questions 1316 \
  --parallel 1316

테스트 결과:

Accuracy: 0.959
Invalid: 0.000
Latency: 29.185 s
Output throughput: 4854.672 token/s

더 알아보기 (Learn more)