vllm launch render — GPU 없는 렌더링 서버
vllm launch render — GPU 없는 렌더링 서버
vllm launch render는 전처리(preprocessing)와 후처리(postprocessing)만 담당하는 GPU 없는 렌더링 서버를 시작하는 명령입니다. 실제 추론은 별도 서버가 처리하고, 이 서버는 프롬프트를 모델 입력 텐서로 만들거나 출력을 사용자에게 돌려주는 역할을 수행합니다.
vllm launch render meta-llama/Llama-3.2-1B-Instruct --port 8100
이 명령은 표준 서빙 파서(parser)를 그대로 재사용하므로, 모델·프론트엔드·네트워킹 관련 CLI 옵션이 vllm serve와 동일한 규칙을 따릅니다.
출처: 문서
본문
JSON CLI 인자
JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.
--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2
리스트 요소는 + 기호로 각각 전달할 수 있습니다.
--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'
핵심 옵션
| 옵션 | 기본값 | 설명 |
|---|---|---|
--headless |
False |
헤드리스 모드로 실행(멀티노드 데이터 병렬 문서 참고) |
--api-server-count / -asc |
데이터 병렬 크기 | 실행할 API 서버 프로세스 수 |
--config |
None |
CLI 옵션을 YAML 설정 파일에서 읽기 |
--grpc |
False |
HTTP OpenAI 호환 서버 대신 gRPC 서버 실행(requires vllm[grpc]) |
--disable-log-stats |
False |
통계 로깅 비활성화 |
--aggregate-engine-logging |
False |
데이터 병렬 시 엔진별이 아닌 집계 통계 로깅 |
--fail-on-environ-validation |
False |
환경 검증 실패 시 오류 발생 |
--shutdown-timeout |
0 |
종료 타임아웃(초). 0 = 즉시 중단, >0 = 대기 |
--enable-log-requests |
False |
요청 정보 로깅(INFO: 요청 ID·파라미터·LoRA, DEBUG: 프롬프트 입력) |
프론트엔드(Frontend)
OpenAI 호환 프론트엔드 서버용 인자 그룹입니다.
--lora-modules,--chat-template,--chat-template-content-format(auto/openai/string)--trust-request-chat-template— 요청별 채팅 템플릿 신뢰 여부--default-chat-template-kwargs— JSON 문자열 또는 개별 키로 전달--response-role— 응답 역할(기본assistant)--return-tokens-as-token-ids— 토큰을 ID로 반환
전체 인자 그룹(모델, 프론트엔드, 네트워킹 등)은 vllm launch render --help로 확인할 수 있습니다.
더 알아보기 (Learn more)
- vllm serve — 표준 서빙 명령(동일한 파서 규칙)
- Configuration Options — 실행 옵션 개요
- Serve args 설정 — YAML 설정 파일 옵션