vLLM 채팅
vLLM 채팅 (vllm chat)
vllm chat는 대화형 채팅 애플리케이션을 실행하는 명령이에요. 로컬에서 모델과 대화하며 프롬프트를 테스트하고, 추론 결과를 확인할 수 있어요. CLI를 기반으로 한 채팅 인터페이스를 제공하며, 요청 프롬프트·응답 포맷 등을 제어할 수 있어요.
이 명령은 서빙 서버를 띄우지 않고 인터랙티브하게 모델과 대화할 때 주로 사용돼요.
기능
vllm chat는 다양한 예제와 기능을 지원하는 채팅 환경을 제공해요. 기본적인 대화부터 시작해서 생성(Generate), 관측성(Observability), 풀링(Pooling), 추론(Reasoning), RL, 음성-텍스트(Speech to Text), 도구 호출(Tool Calling) 등으로 확장할 수 있어요.
주요 사용 시나리오를 정리하면 다음과 같아요.
- 기본(Basic) — 모델과 단일 대화
- 배포(Deployment) — 분산 서빙 환경에서의 대화
- 생성(Generate) — 텍스트 생성 결과 확인
- 추론(Reasoning) — 추론 모델과의 대화
- 관측성(Observability) — 로깅·메트릭 확인
- 도구 호출(Tool Calling) — 도구를 호출하는 에이전트형 대화
실행
vllm chat --model meta-llama/Llama-3.1-8B-Instruct
모델을 지정하고 대화를 시작하면, 프롬프트를 입력할 때마다 모델의 응답을 확인할 수 있어요.
더 알아보기
- vLLM vllm serve 문서: OpenAI 호환 서버 서빙
- vLLM vllm complete 문서: 비대화형 프롬프트 완료
- vLLM vllm run-batch 문서: 오프라인 배치 추론