LLM·에이전트 AI 기능 — 서빙·파인튜닝·RAG·MCP
LLM·에이전트 AI 기능 — 서빙·파인튜닝·RAG·MCP
Anyscale은 오픈소스 LLM을 한 플랫폼에서 서빙·파인튜닝·배치 추론하고, RAG와 에이전트(agentic) 애플리케이션을 짓는 데까지 폭넓게 씁니다. 대표 애플리케이션은 코드 생성, text-to-SQL, 도구 사용 최적화예요.
LLM 서빙
- Ray Serve가 확장 가능한 오케스트레이션 계층으로, 프로덕션 배포를 단순화해요.
- 통합 멀티모델 배포 — 단일 배포에서 여러 모델·변형을 서빙.
- 동적 멀티-LoRA — 하나의 베이스 모델로 여러 파인튜닝 어댑터를 동시에 서빙.
파인튜닝·포스트트레이닝
사전학습된 모델을 특정 도메인·동작에 맞게 적응시켜요. 전체 파인튜닝부터 LoRA·QLoRA 같은 파라미터 효율 방식까지, 분산 학습 전략(FSDP, DeepSpeed, Megatron)과 함께 제공됩니다.
- LLaMA-Factory로 파인튜닝
- Ray Train + DeepSpeed로 LLM 파인튜닝
배치 추론
오프라인 작업(데이터 보강, 분석, 모델 평가)에는 ray.data.llm을 씁니다. vLLM과 직접 통합되어 실시간 서빙의 최적화(연속 배칭 등)를 배치 맥락에도 가져옵니다.
RAG·에이전트·MCP
- RAG: 색인 파이프라인과 지연 민감 서빙 앱을 같은 프레임워크로 관리.
- 에이전트 오케스트레이션: LLM 호출·도구 실행·상태 업데이트 등 복잡한 워크플로 지원.
- MCP: 에이전트가 쓰는 도구(코드 인터프리터, DB 쿼리 엔진, API)를 독립 마이크로서비스로 패키징해 Ray Serve로 배포.
더 알아보기
https://docs.anyscale.com/llm/serving— LLM 서빙 가이드https://docs.anyscale.com/examples/deploy-llms— RayLLM 템플릿