Cerebras 추론 시작하기 (Quickstart)

Cerebras 추론 시작하기 (Quickstart)

세계에서 가장 빠른 추론을 지향하는 Cerebras Inference를 처음 써보는 자리예요. 이미 LLM API에 익숙하다면 API 레퍼런스로 바로 넘어가도 되고, 그게 아니라면 아래 흐름을 따라 한 번에 호출해 보면 돼요.

출처: Cerebras Inference - Quickstart

시작해 볼까요

Cerebras Inference는 OpenAI 호환 API를 제공해서, 익숙한 chat.completions 형태로 모델을 호출할 수 있어요. 기본 호출은 이렇게 만들어요.

  1. Cerebras Cloud 콘솔에서 무료 API 키(CEREBRAS_API_KEY)를 발급받아요.
  2. Cerebras Inference SDK(cerebras.cloud.sdk)를 설치하고 클라이언트를 만들어요.
  3. client.chat.completions.create()로 모델에 메시지를 보내요.

가장 흔한 첫 호출은 대화형 채팅 컴플리션이에요. 요청에는 모델 ID와 메시지 목록이 핵심이고, 응답은 생성된 텍스트를 담고 있어요.

  • 401 UnauthorizedCEREBRAS_API_KEY가 코드를 실행하는 셸에 설정돼 있지 않다는 뜻이에요. 같은 터미널에서 키 설정 명령을 다시 실행해 보세요. Windows에서 setx를 쓴 경우에는 새 터미널을 열어야 반영돼요.
  • 404 model not foundmodel ID가 잘못 표기됐거나, 더 이상 지원되지 않거나, 계정에 없을 때 나와요. 공개 모델 전체 목록은 모델 페이지에서 확인할 수 있어요.
  • 429 Too Many Requests — 속도 제한에 걸렸다는 뜻이에요. 무료 계정은 유료 계정보다 분당 한도가 낮아요. 현재 할당량과 상향 요청 방법은 Rate limits를 참고하세요.

나머지 상태 코드는 오류 레퍼런스에서 확인할 수 있어요.

다음 단계

더 알아보기