Cerebras (Inference)
Cerebras (Inference)
Cerebras는 웨이퍼 스케일(Wafer-Scale) 칩을 기반으로 세계에서 가장 빠른 LLM 추론 서비스를 제공하는 인퍼런스 프랫폼이에요. OpenAI 호환 API와 자체 Cerebras Inference SDK로 GPT 계열·Qwen 계열 오픈소스 모델을 매우 빠르게 서빙해요.
주요 문서
- 시작하기: Quickstart, 모델 카탈로그
- 추론 기능: 스트리밍, 구조화된 출력, 도구 호출, 프롬프트 캐싱
- API 레퍼런스: 채팅 컴플리션, 컴플리션, 모델 조회 등