LLM·에이전트 AI 기능 — 서빙·파인튜닝·RAG·MCP

LLM·에이전트 AI 기능 — 서빙·파인튜닝·RAG·MCP

Anyscale은 오픈소스 LLM을 한 플랫폼에서 서빙·파인튜닝·배치 추론하고, RAG와 에이전트(agentic) 애플리케이션을 짓는 데까지 폭넓게 씁니다. 대표 애플리케이션은 코드 생성, text-to-SQL, 도구 사용 최적화예요.

출처: https://docs.anyscale.com/llm

LLM 서빙

  • Ray Serve가 확장 가능한 오케스트레이션 계층으로, 프로덕션 배포를 단순화해요.
  • 통합 멀티모델 배포 — 단일 배포에서 여러 모델·변형을 서빙.
  • 동적 멀티-LoRA — 하나의 베이스 모델로 여러 파인튜닝 어댑터를 동시에 서빙.

파인튜닝·포스트트레이닝

사전학습된 모델을 특정 도메인·동작에 맞게 적응시켜요. 전체 파인튜닝부터 LoRA·QLoRA 같은 파라미터 효율 방식까지, 분산 학습 전략(FSDP, DeepSpeed, Megatron)과 함께 제공됩니다.

  • LLaMA-Factory로 파인튜닝
  • Ray Train + DeepSpeed로 LLM 파인튜닝

배치 추론

오프라인 작업(데이터 보강, 분석, 모델 평가)에는 ray.data.llm을 씁니다. vLLM과 직접 통합되어 실시간 서빙의 최적화(연속 배칭 등)를 배치 맥락에도 가져옵니다.

RAG·에이전트·MCP

  • RAG: 색인 파이프라인과 지연 민감 서빙 앱을 같은 프레임워크로 관리.
  • 에이전트 오케스트레이션: LLM 호출·도구 실행·상태 업데이트 등 복잡한 워크플로 지원.
  • MCP: 에이전트가 쓰는 도구(코드 인터프리터, DB 쿼리 엔진, API)를 독립 마이크로서비스로 패키징해 Ray Serve로 배포.

더 알아보기

  • https://docs.anyscale.com/llm/serving — LLM 서빙 가이드
  • https://docs.anyscale.com/examples/deploy-llms — RayLLM 템플릿