모델 카탈로그 (Model Catalog)

모델 카탈로그 (Model Catalog)

Cerebras 공개 엔드포인트에서 어떤 모델을 쓸 수 있는지 한눈에 보는 페이지예요. 무료 체험과 종량제(pay-as-you-go) 모두에서 쓸 수 있고, 모델마다 컨텍스트 길이와 속도가 달라요.

출처: Cerebras Inference - Model Catalog

사용 가능한 모델

Cerebras 공개 엔드포인트의 모델은 무료 체험과 종량제 티어에서 사용할 수 있어요. 단, 속도 제한요금이 적용돼요. 더 많은 모델 패밀리나 예약 용량, 높은 처리량, 운영 SLA가 필요하다면 전용 엔드포인트를 보세요.

새로 시작하는 분이라면 Quickstart를 따라 첫 API 호출을 해보는 걸 추천해요. 용도별로 모델을 고르고 싶다면 모델 선택 가이드를 참고하세요.

모델 이름 모델 ID 파라미터 컨텍스트 (무료 / 유료) 속도 (토큰/초)
OpenAI GPT OSS gpt-oss-120b 1200억 65k / 131k 약 3000
Qwen 3.8 27B qwen-3.8-27b 270억 64k / 128k 약 1850

더 많은 모델이 필요하면 전용 엔드포인트에서 다양한 모델 패밀리를 확인할 수 있어요.

모델 압축 (Model Compression)

플랫폼에 서빙되는 각 모델의 압축 상태를 투명하게 공개해요. Cerebras는 커뮤니티의 다양한 오픈소스 모델을 호스팅하고, 공개 엔드포인트에서는 가지치기(pruned)된 모델을 호스팅하지 않아요. 공개 엔드포인트로 서빙되는 모든 모델은 원본 상태(프루닝되지 않은) 그대로예요.

REAP(Router-weighted Expert Activation Pruning) 같은 프루닝 기법을 연구하고 있지만, 이렇게 프루닝된 모델은 Hugging Face의 연구 커뮤니티에 공유되며 공유 API를 통해서는 제공되지 않아요. REAP에 대해 더 알고 싶다면 연구 블로그를 보세요.

Cerebras는 품질을 유지하기 위해 저장 시 선택적 weight-only 양자화를 사용해요. 가중치를 부분 16비트 / 8비트 / 4비트로 저장하되 업계 표준에 맞추고, 품질에 민감한 레이어는 전체 정밀도로 유지하면서 요청 시 역양자화(dequantization)를 수행해요. 활성화(activations), 어텐션, KV 캐시는 전체 정밀도로 유지되고 양자화되지 않아요.

자주 묻는 질문

  • 프루닝된 모델을 제공하지 않나요? 네. 기존 모든 엔드포인트는 원본 모델을 수정 없이 서빙해요. 호스팅 포트폴리오에서 프루닝으로 모델 아키텍처를 바꾸지 않아요.
  • REAP 모델은 어디서 볼 수 있나요? Cerebras REAP 컬렉션에서 연구·실험 용도로 볼 수 있어요. 이 모델은 프루닝 연구를 보여주지만 프로덕션 API로는 서빙되지 않아요.

압축(Compression) 은 모델 크기나 계산 요구량을 줄이는 기법의 총칭이에요. 대표적으로 두 가지가 있어요.

  • 양자화 (Quantization) — 모델 가중치를 나타내는 숫자의 정밀도를 낮추는 기법이에요. 예를 들어 FP16에서 FP8로 바꾸면 모델 아키텍처는 그대로 두고 메모리 사용량만 줄어들어요.
  • 프루닝 (Pruning) — 레이어나 전문가(experts) 같은 모델 일부를 영구히 제거해 크기를 줄이는 기법이에요. 아키텍처가 바뀌어 다른 모델이 돼요.

더 알아보기