vllm launch render — GPU 없는 렌더링 서버

vllm launch render — GPU 없는 렌더링 서버

vllm launch render는 전처리(preprocessing)와 후처리(postprocessing)만 담당하는 GPU 없는 렌더링 서버를 시작하는 명령입니다. 실제 추론은 별도 서버가 처리하고, 이 서버는 프롬프트를 모델 입력 텐서로 만들거나 출력을 사용자에게 돌려주는 역할을 수행합니다.

vllm launch render meta-llama/Llama-3.2-1B-Instruct --port 8100

이 명령은 표준 서빙 파서(parser)를 그대로 재사용하므로, 모델·프론트엔드·네트워킹 관련 CLI 옵션이 vllm serve와 동일한 규칙을 따릅니다.

출처: 문서

본문

JSON CLI 인자

JSON CLI 인자를 넘길 때, 아래 두 방식은 서로 동등합니다.

--json-arg '{"key1": "value1", "key2": {"key3": "value2"}}'
--json-arg.key1 value1 --json-arg.key2.key3 value2

리스트 요소는 + 기호로 각각 전달할 수 있습니다.

--json-arg '{"key4": ["value3", "value4", "value5"]}'
--json-arg.key4+ value3 --json-arg.key4+='value4,value5'

핵심 옵션

옵션 기본값 설명
--headless False 헤드리스 모드로 실행(멀티노드 데이터 병렬 문서 참고)
--api-server-count / -asc 데이터 병렬 크기 실행할 API 서버 프로세스 수
--config None CLI 옵션을 YAML 설정 파일에서 읽기
--grpc False HTTP OpenAI 호환 서버 대신 gRPC 서버 실행(requires vllm[grpc])
--disable-log-stats False 통계 로깅 비활성화
--aggregate-engine-logging False 데이터 병렬 시 엔진별이 아닌 집계 통계 로깅
--fail-on-environ-validation False 환경 검증 실패 시 오류 발생
--shutdown-timeout 0 종료 타임아웃(초). 0 = 즉시 중단, >0 = 대기
--enable-log-requests False 요청 정보 로깅(INFO: 요청 ID·파라미터·LoRA, DEBUG: 프롬프트 입력)

프론트엔드(Frontend)

OpenAI 호환 프론트엔드 서버용 인자 그룹입니다.

  • --lora-modules, --chat-template, --chat-template-content-format(auto/openai/string)
  • --trust-request-chat-template — 요청별 채팅 템플릿 신뢰 여부
  • --default-chat-template-kwargs — JSON 문자열 또는 개별 키로 전달
  • --response-role — 응답 역할(기본 assistant)
  • --return-tokens-as-token-ids — 토큰을 ID로 반환

전체 인자 그룹(모델, 프론트엔드, 네트워킹 등)은 vllm launch render --help로 확인할 수 있습니다.

더 알아보기 (Learn more)