vLLM 완료 요청
vLLM 완료 요청 (vllm complete)
vllm complete는 실행 중인 OpenAI 호환 서버에 프롬프트 완료(completion) 요청을 보내는 명령이에요. vllm serve로 띄운 서버의 /v1 엔드포인트에 직접 요청하지 않고, CLI에서 간편하게 프롬프트를 채우고 결과를 확인할 수 있어요.
주로 서버가 정상 동작하는지, 특정 프롬프트에 모델이 어떻게 응답하는지를 빠르게 확인하는 용도로 써요.
주요 인자
- --url — 실행 중인 OpenAI 호환 RESTful API 서버의 영구 링크 URL. 기본
http://localhost:8000/v1 - --model-name — 프롬프트 완료에 사용할 모델 이름. 기본은 list models API 호출의 첫 번째 모델
- --api-key — OpenAI 서비스용 API 키. 제공하면 환경변수를 통해 얻은 API 키를 덮어씀. 주의: 이 옵션은 OpenAI 호환 API 엔드포인트에만 적용되고 서버의 다른 엔드포인트에는 적용되지 않아요
- --max-tokens — 출력 시퀀스당 생성할 최대 토큰 수
- -q, --quick — 단일 프롬프트를 보내고 완료 출력을 출력한 뒤 종료
- --stats — 각 응답 후 TTFT와 TPS 통계 출력. 기본
False
사용 예시
# 기본 서버에 단일 프롬프트 완료 요청 후 종료
vllm complete -q "The meaning of life is"
# 최대 토큰 수와 통계 지정
vllm complete --model-name my-model --max-tokens 100 --stats "Explain how vLLM works"
-q/--quick를 쓰면 비대화형으로 한 번 실행하고 끝내기 때문에 스크립트나 CI에서 서버 응답을 검증할 때 유용해요. --stats를 켜면 각 응답의 TTFT(Time To First Token, 첫 토큰까지 걸린 시간)와 TPS(Tokens Per Second, 초당 토큰 수)를 확인할 수 있어요.
더 알아보기
- vLLM vllm serve 문서: 서버 띄우기
- vLLM vllm chat 문서: 대화형 채팅
- vLLM vllm bench throughput 문서: 처리량 벤치마킹