vLLM Reasoning Outputs — 추론 모델 서빙 실전

vLLM Reasoning Outputs — 추론 모델 서빙 실전

vLLM은 DeepSeek R1 같은 추론 모델을 서빙할 때, 출력에 추론 단계(thinking)와 최종 결론을 함께 담는 reasoning 필드를 지원해요. 일반 모델 출력에는 이 필드가 없어요.

지원 모델

DeepSeek R1 시리즈, Qwen3(reasoning 기본), Gemma 4, GLM-4.5 등 다양한 추론 모델계열을 지원해요. 모델별 파서 이름(예: deepseek_r1)으로 구조화 출력·도구 호출 지원 여부도 표에 정리돼 있어요.

서빙 예제

vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B   --reasoning-parser deepseek_r1

요청하면 응답의 delta.reasoning 필드에 추론 내용이 스트리밍돼요. 모델별로 thinking 활성화 방식을 다르게 지정해야 해요(예: Qwen3는 enable_thinking).

실전 포인트

  • OpenAI 파이썬 클라이언트는 reasoning 속성을 공식 지원하지 않으므로, 필요한 경우 vLLM 확장으로 처리해요.
  • 추론 결과를 UI에 어떻게 보여줄지(노출·숨김) 정책 결정이 필요해요.

더 알아보기