Cerebras 추론 시작하기 (Quickstart)
Cerebras 추론 시작하기 (Quickstart)
세계에서 가장 빠른 추론을 지향하는 Cerebras Inference를 처음 써보는 자리예요. 이미 LLM API에 익숙하다면 API 레퍼런스로 바로 넘어가도 되고, 그게 아니라면 아래 흐름을 따라 한 번에 호출해 보면 돼요.
시작해 볼까요
Cerebras Inference는 OpenAI 호환 API를 제공해서, 익숙한 chat.completions 형태로 모델을 호출할 수 있어요. 기본 호출은 이렇게 만들어요.
- Cerebras Cloud 콘솔에서 무료 API 키(
CEREBRAS_API_KEY)를 발급받아요. - Cerebras Inference SDK(
cerebras.cloud.sdk)를 설치하고 클라이언트를 만들어요. client.chat.completions.create()로 모델에 메시지를 보내요.
가장 흔한 첫 호출은 대화형 채팅 컴플리션이에요. 요청에는 모델 ID와 메시지 목록이 핵심이고, 응답은 생성된 텍스트를 담고 있어요.
- 401 Unauthorized —
CEREBRAS_API_KEY가 코드를 실행하는 셸에 설정돼 있지 않다는 뜻이에요. 같은 터미널에서 키 설정 명령을 다시 실행해 보세요. Windows에서setx를 쓴 경우에는 새 터미널을 열어야 반영돼요. - 404 model not found —
modelID가 잘못 표기됐거나, 더 이상 지원되지 않거나, 계정에 없을 때 나와요. 공개 모델 전체 목록은 모델 페이지에서 확인할 수 있어요. - 429 Too Many Requests — 속도 제한에 걸렸다는 뜻이에요. 무료 계정은 유료 계정보다 분당 한도가 낮아요. 현재 할당량과 상향 요청 방법은 Rate limits를 참고하세요.
나머지 상태 코드는 오류 레퍼런스에서 확인할 수 있어요.
다음 단계
- 모델 고르기 — 용도에 맞는 모델은 모델 선택 가이드에서 찾을 수 있어요.
- 기능 탐색하기 — 스트리밍, 도구 호출, 구조화된 출력, 리즈닝을 애플리케이션에 붙여볼 수 있어요.
- Cerebras에 맞게 설계하기 — 웨이퍼 스케일 추론의 장점을 살리는 아키텍처 패턴을 볼 수 있어요.
- API 둘러보기 — 사용 가능한 모든 엔드포인트와 파라미터는 API 레퍼런스에 정리돼 있어요.