GLM 모델 둘러보기
GLM 모델 둘러보기
대화형 애플리케이션을 만들려면 먼저 어떤 모델을 쓸지 골라야 하는데요. 지능형 모델이라고 불리는 GLM 계열은 텍스트 생성과 추론을 중심으로, 영상 이해·이미지 생성·음성·OCR까지 폭넓게 갖춰져 있어서 목적에 따라 조합해서 쓰면 됩니다. 이번 글에서는 전 구성을 아우르는 핵심 모델들의 역할과, 추론할 때 바로 입력하게 될 컨텍스트 길이 같은 세부 사항을 정리해 드릴게요.
핵심 모델 한눈에 보기
가장 최근에 나온 플래그십은 GLM-5.3이에요. 복잡한 소프트웨어 엔지니어링이나 터미널 조작, 더 넓은 범위의 Agent 작업에서 눈에 띄게 좋아졌고, 효과와 Token 활용 사이의 균형도 잘 잡혔죠. 그리고 GLM-5.3-Flash는 이미지·영상을 원어민처럼 이해하는 다중모달 모델이라서, 연구 분석이나 문서 제작 같은 전문 작업을 스스로 해내는 데 유리합니다.
아래는 현재 주력으로 쓰는 9개 모델의 배치입니다.
| 모델 | 특징 | 컨텍스트 | 최대 출력 |
|---|---|---|---|
| GLM-5.3 | 프로그래밍·에이전트 능력이 뛰어난 플래그십, 장거리 작업에 강함 | 1M | 128K |
| GLM-5.3-Flash | 저렴한 글로벌 선도 다중모달, 이미지·영상 이해와 인터랙티브 코드 생성 | 1M | 128K |
| GLM-5.2 | 복잡한 장기 작업을 안정적으로 수행, Coding 능력 대폭 향상 | 1M | 128K |
| GLM-Image | 플래그십 이미지 생성, 복잡한 지시와 지식 밀집 생성에 강함, 다중 해상도 | - | - |
| GLM-OCR | 가벼운 문서·그림 분석, 고정밀·고효율, 복잡한 레이아웃 파싱 | 단일 그림 ≤ 10 MB, PDF ≤ 50 MB, 최대 100쪽 | - |
| GLM-ASR-2512 | 고정밀 음성 인식, 여러 언어·방언 지원 | - | - |
| GLM-TTS | 음성 합성, 초인간적 목소리 생성과 감정 표현, 비스트리밍·스트리밍 | - | - |
| CogVideoX-3 | 플래그십 영상 생성, 물리 시뮬레이션 강화, 시작·끝 프레임 생성 | - | - |
| Embedding-3 | 3세대 텍스트 벡터화(V3), 의미 검색·클러스터링·주제 모델링 | 8K | - |
GLM-5.3과 GLM-5.3-Flash는 컨텍스트 1M(약 100만 토큰)을 받아들이고 최대 128K까지 출력할 수 있어서 긴 문서나 대규모 코드베이스를 한 번에 넣고 다룰 수 있어요. 반면 임베딩 전용인 Embedding-3은 8K 컨텍스트로 동작합니다.
모델 고르는 기준
- 일반 대화·추론 →
GLM-5.3을 기본으로 두면 됩니다. - 비용 효율 + 이미지/영상 이해 →
GLM-5.3-Flash. - 이미지·영상 생성, 음성, OCR, 벡터 검색 → 각각
GLM-Image,CogVideoX-3,GLM-TTS/GLM-ASR-2512,GLM-OCR,Embedding-3.
모델 코드로는 glm-5.3처럼 model 필드에 바로 넣어 호출해요. 각 모델의 실시간 가격과 세부 한도는 공식 요금 페이지에서 확인하는 게 정확합니다.
더 알아보기 (Learn more)
- 대화 보완 API (Chat Completions) — 실제로 모델을 호출하는 방법
- 깊은 사고로 추론하기 — 추론 모델의
thinking파라미터 - 모델 관련 발표 기록