컨텍스트 윈도우 (Context Windows)

컨텍스트 윈도우 (Context Windows)

대화가 길어질수록 모델이 참고할 수 있는 토큰 한도에 점점 가까워져요. 컨텍스트 윈도우는 모델이 응답을 만들 때 참조할 수 있는 모든 텍스트의 총량이에요. 이 개념을 이해하면 긴 대화·에이전트 워크로드에서 컨텍스트를 어떻게 관리할지 설계할 수 있어요.

출처: https://platform.claude.com/docs/en/build-with-claude/context-windows

컨텍스트 윈도우의 동작

컨텍스트 윈도우는 모델이 학습 때 봤던 방대한 데이터와는 달리, 이번 요청의 '작업 메모리'라고 보면 돼요. 대화가 진행되면서 사용자 메시지와 어시스턴트 응답이 점점 쌓여요. 이전 턴은 완전히 보존되고, 컨텍스트 윈도우는 대화 히스토리와 모델이 새로 만들어낼 출력을 함께 담아요.

여기서 중요한 포인트 하나가 있어요. 토큰 수가 늘어날수록 정확도와 회상력이 떨어지는 컨텍스트 로테이션(context rot) 현상이 생겨요. 그래서 컨텍스트에 '얼마나 많은 공간이 있느냐'만큼이나 '무엇을 넣느냐'가 중요해요.

요청에 들어가는 모든 것이 컨텍스트 윈도우를 차지해요. 시스템 프롬프트, messages의 모든 메시지(도구 결과, 이미지, 문서 포함), 도구 정의가 다 포함돼요. 모델이 해당 턴에 만들어내는 출력(확장 사고 포함)도 차지하죠. 매 응답의 usage 필드가 요청이 소모한 양을 알려줘요.

모델별 컨텍스트 윈도우 크기

현재 최상위 모델들은 대부분 1M 토큰 컨텍스트 윈도우를 지원해요. Claude Opus 5, Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5, Sonnet 4.6가 그렇고, Claude Mythos Preview도 1M이에요. 1M 윈도우를 가진 모델은 요청 하나당 최대 128k 출력 토큰(max_tokens)을 생성할 수 있어요. 반면 Claude Sonnet 4.5를 포함한 그 외 모델은 200k 토큰 윈도우예요.

1M 컨텍스트를 가진 모든 모델에서 1M이 기본값이에요. 베타 헤더가 필요 없고, 긴 컨텍스트 요청도 표준 가격으로 청구돼요.

생각(thinking)과 도구 사용

컨텍스트 윈도우에서 생각 토큰도 빠지지 않아요. 확장 사고를 켜면 입·출력 토큰 전부(생각 토큰 포함)가 컨텍스트 윈도우 한도에 들어가요. 생각 토큰은 max_tokens의 일부이고, 출력 토큰으로 청구되고 속도 제한에도 포함돼요.

이전 턴의 생각 블록이 컨텍스트에 남는지는 모델마다 달라요. Claude Opus 4.5와 그 이후 Opus 모델, Sonnet 4.6 이후 모델, Fable 5, Mythos 5 등에서는 이전 생각 블록을 기본으로 보존해요. 그 이전 Opus/Sonnet 모델과 모든 Haiku 모델은 이전 생각 블록을 자동으로 제거해서 대화 내용용 토큰 공간을 확보해요.

도구 결과를 돌려줄 때는 그 도구 요청에 딸린 생각 블록을 수정하지 않고 그대로 포함해야 해요. API가 암호화 서명으로 생각 블록의 진위를 확인하니까, 조금이라도 바꾸면 오류를 돌려줘요.

컨텍스트 관리는 어떻게 하나요

대화가 자주 한도에 가까워진다면 서버 측 압축(compaction) 을 쓰는 게 주된 전략이에요. 압축은 서버가 대화 앞부분을 자동으로 요약해서, 컨텍스트 윈도우 한도를 넘어서도 대화를 이어가게 해줘요. Claude 4.6 이후 모델에서 베타로 제공돼요.

더 세부적인 조정이 필요하면 컨텍스트 편집(context editing)을 볼 수 있는데, 에이전트 워크플로에서 오래된 도구 결과를 지우거나 생각 블록을 관리하는 전략이 담겨 있어요.

입력만으로 이미 컨텍스트 윈도우를 초과하면 API가 400 invalid_request_error("prompt is too long")를 돌려줘요. 입력 토큰과 max_tokens를 합쳐서 한도를 넘는 경우에는, Claude 4.5 이후 모델에서는 요청을 받아주다가 생성 중 한도에 닿으면 stop_reason: "model_context_window_exceeded"로 멈춰요. 한도 안에 머물도록 요청 전에 «토큰 카운팅» API로 토큰 사용량을 미리 가늠하는 걸 권장해요.

더 알아보기

  • 긴 대화를 자동으로 요약해 이어가는 법은 «Compaction» 문서를 봐요.
  • 컨텍스트 편집 전략은 «Context editing» 문서를 봐요.
  • 모델별 컨텍스트 크기와 입·출력 가격은 모델 비교 표를 봐요.