VLA 정책 개요

VLA 정책 개요 (VLA Overview)

SGLang으로 VLA(Vision-Language-Action) 정책을 배포하고 사용하는 실용 가이드를 모아둔 문서입니다. 카메라 관찰, 언어 지시, 로봇 상태를 연속 동작 청크로 매핑하는 워크로드를 다뤄요.

출처: 문서

본문

SGLang으로 VLA(Vision-Language-Action) 정책을 배포·사용하는 실용 가이드.

VLA 정책은 카메라 관찰(camera observations), 언어 지시(language instructions), 로봇 상태(robot state)를 연속 동작 청크(continuous action chunks)로 매핑합니다. 이들은 디퓨전 파이프라인과 런타임 장치 일부를 공유하지만, 사용자 입장에서의 워크로드는 이미지·비디오 생성이 아니라 로봇 동작 추론(robot action inference)이에요.

이 섹션은 VLA 정책을 디퓨전 모델 쿡북과 분리해, 로봇 배포가 자기만의 입력 스키마(input schemas), 정책 엔드포인트(policy endpoints), 캐시 동작(cache behavior), 제어 루프 성능 목표(control-loop performance targets)를 별도로 문서화할 수 있게 합니다.

OpenPI

더 알아보기 (Learn more)

  • Pi0.5 — OpenPI 기반 VLA 정책 예시