Ling-2.5-1T
Ling-2.5-1T
Ling-2.5-1T은 Ling 계열의 최신 플래그십 인스턴트 모델이에요. Thinking 모델이 지능의 한계를 높이는 반면, 인스턴트 모델은 효율과 성능의 균형을 맞춰 그 영향력을 확장해요 — AGI를 더 강력하게, 동시에 더 접근 가능하게 만들어요. Ling-2.5-1T는 모델 아키텍처, 토큰 효율, 선호 정렬(preference alignment) 전반에 걸쳐 종합적인 업그레이드를 제공하며, 보편적으로 접근 가능한 AI를 새로운 품질 수준으로 끌어올리도록 설계되었어요.
트리리언 파라미터 규모의 BF16 모델로 최소 2개 노드가 필요하며, Context Length가 256K → 1M(YaRN)로 확장됐어요. MIT 라이선스로 공개됐어요.
이 문서는 SGLang으로 Ling-2.5-1T를 멀티노드 배포하고, 함수 호출 같은 기능을 사용하는 방법을 설명해요.
원문 페이지에는 하드웨어 플랫폼에 맞는 배포 명령을 자동 생성하는 대화형 선택기가 포함되어 있어요. 위키에서는 렌더링되지 않으니 아래 지침을 직접 참고하면 돼요.
출처: 문서
본문
1. 모델 소개
Ling-2.5-1T은 Ling 계열의 최신 플래그십 인스턴트 모델이에요. Thinking 모델이 지능의 한계를 높이는 반면, 인스턴트 모델은 효율과 성능의 균형을 맞춰 그 영향력을 확장해요 — AGI를 더 강력하게, 동시에 더 접근 가능하게 만들어요. Ling-2.5-1T는 모델 아키텍처, 토큰 효율, 선호 정렬 전반에 걸쳐 종합적인 업그레이드를 제공하며, 보편적으로 접근 가능한 AI를 새로운 품질 수준으로 끌어올리도록 설계되었어요.
주요 특징:
- 트리리언 규모 모델: 총 1T 파라미터에 활성 63B 파라미터(이전 세대 51B에서 증가). 사전 학습 코퍼스도 20T에서 29T 토큰으로 확장. 효율적인 하이브리드 선형 어텐션 아키텍처(1:7 MLA + Lightning Linear Attention)를 활용해 최대 1M 토큰의 컨텍스트 길이를 처리하면서도 매우 높은 처리량을 제공해요.
- 토큰 효율: "Correctness"와 "Process Redundancy"를 결합한 복합 보상 메커니즘을 도입해 인스턴트 모델의 효율-성능 균형의 최전선을 더 밀어붙여요. 비교 가능한 토큰 효율 수준에서 Ling-2.5-1T의 추론 능력은 전작을 크게 능가하며, 일반적으로 ~4배 출력 토큰을 소비하는 최첨단 "thinking 모델" 수준에 근접해요.
- 선호 정렬: 양방향 RL 피드백, 에이전트 기반 지시 제약 검증 같은 정제된 정렬 전략을 통해 창작 글쓰기, 지시 따르기 등 선호 정렬 작업에서 이전 세대 대비 큰 개선을 이뤄요.
- 에이전트 능력: 대규모 고충실도 상호작용 환경에서 Agentic RL로 훈련되어 Claude Code, OpenCode, OpenClaw 같은 주류 에이전트 플랫폼과 호환돼요. 일반 함수 호출 벤치마크 BFCL-V4에서 선도적인 오픈소스 성능을 달성해요.
- 컨텍스트 길이: 256K → 1M (YaRN)
제공 모델:
- BF16: inclusionAI/Ling-2.5-1T
라이선스: MIT
2. SGLang 설치
Ling-2.5-1T는 표준 SGLang Docker 이미지에서 실행돼요:
# NVIDIA (H200 / B200 / GB200 / GB300)
docker pull lmsysorg/sglang:latest
다른 설치 방법은 공식 SGLang 설치 가이드를 참고하세요.
Ling-2.5-1T는 nightly PyPI 빌드로도 지원돼요. 설정 안내는 SGLang Installation (PyPI) 가이드를 참고하세요.
3. 모델 배포
Ling-2.5-1T는 트리리언 파라미터 BF16 모델로 멀티노드 배포(최소 2개 노드)가 필요해요. 아래 구성 선택기로 하드웨어 플랫폼에 맞는 배포 명령을 생성하세요.
구성 팁
- 이 모델은 커스텀 모델링 코드 때문에
--trust-remote-code플래그가 필요해요. - 이 모델에서
--tp-size는 최대 8로 설정할 수 있어요. GPU가 더 많다면--pp-size를 늘려 추가 노드로 확장하세요. --model-loader-extra-config '{"enable_multithread_load": "true","num_threads": 64}'를 추가하면 더 빠른 모델 로딩이 가능해요.- H200/GB200/GB300 2노드 배포에서는 모델이 대부분의 GPU 메모리를 차지하므로 OOM을 피하려면
--mem-frac 0.95가 필요해요. 더 나은 처리량을 원하면 4노드 배포를 고려하세요(자세한 내용은 모델 카드 참고).
4. 모델 호출
4.1 기본 사용법
예를 들어 2개 H200 노드에서 서버를 시작해요:
export MASTER_IP=10.10.0.1 # The IP of Node 0
export PORT=30000
export DIST_PORT=50000
# Node 0:
python3 -m sglang.launch_server \
--model-path inclusionAI/Ling-2.5-1T \
--trust-remote-code \
--tp-size 8 \
--pp-size 2 \
--nnodes 2 \
--node-rank 0 \
--host 0.0.0.0 \
--port ${PORT} \
--dist-init-addr ${MASTER_IP}:${DIST_PORT} \
--tool-call-parser qwen \
--model-loader-extra-config '{"enable_multithread_load": "true","num_threads": 64}' \
--mem-frac 0.95
# Node 1:
python3 -m sglang.launch_server \
--model-path inclusionAI/Ling-2.5-1T \
--trust-remote-code \
--tp-size 8 \
--pp-size 2 \
--nnodes 2 \
--node-rank 1 \
--dist-init-addr ${MASTER_IP}:${DIST_PORT} \
--tool-call-parser qwen \
--model-loader-extra-config '{"enable_multithread_load": "true","num_threads": 64}' \
--mem-frac 0.95
서버가 실행되면 마스터 노드로 요청을 보내요:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'
출력:
{
"id": "e82af153da844ee6aed7a27a3187f2f4",
"object": "chat.completion",
"created": 1771216764,
"model": "auto",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "The capital of France is **Paris**.\n\n**Additional details:**\n* It is the largest city in France.\n* It is located in the north-central part of the country along the Seine River.\n* Paris is often referred to as \"The City of Light\" (*La Ville Lumière*).",
"reasoning_content": null,
"tool_calls": null
},
"logprobs": null,
"finish_reason": "stop",
"matched_stop": 156895
}
],
"usage": {
"prompt_tokens": 25,
"total_tokens": 93,
"completion_tokens": 68,
"prompt_tokens_details": null,
"reasoning_tokens": 0
}
}
더 많은 API 사용 예시는 아래를 참고하세요:
4.2 함수 호출 예시
이 모델은 qwen 함수 호출 파서를 사용하며, 배포 명령(--tool-call-parser qwen)에 활성화되어 있어요. 표준 OpenAI 호환 방식으로 함수 호출 요청을 보낼 수 있어요.