Replicate (클라우드 LLM 추론·배포)

Replicate (클라우드 LLM 추론·배포)

Replicate는 머신러닝 모델을 클라우드 API로 바로 실행할 수 있게 해 주는 추론(inference) 플랫폼이에요. GPU 인프라를 직접 관리하지 않아도, 다른 사람이 공개한 오픈소스 LLM·이미지·비디오 모델을 몇 줄이면 호출할 수 있고요. 직접 만든 모델도 Cog로 패키징해 상시 배포(Deployment)로 운영할 수 있어요.

이 카테고리의 문서

  • 예측(Prediction): 모델을 실행하는 기본 단위. 동기·비동기 실행, 수명주기, SSE 스트리밍
  • 모델 실행: 파이썬·자바스크립트 클라이언트로 첫 추론 호출하기
  • 배포(Deployment): 자체 모델을 고정 하드웨어·오토스케일링으로 상시 API로 운영하기

출처: https://replicate.com/docs