Long Context 개요 — 1M 토큰 활용법
Long Context 개요
Gemini 등 많은 모델은 100만 토큰 이상의 컨텍스트 윈도우를 갖는 시대예요. 1M 토큰은 대략 코드 5만 줄, 평균 영문 소설 8권, 200개 이상의 팟캐스트 에피소드 분량이에요.
무엇이 달라지는가
작은 컨텍스트 모델은 '오래된 메시지 버리기, 요약, RAG, 프롬프트 필터링' 같은 우회 전략이 필요했어요. Long Context 모델은 필요한 정보를 앞에 다 넣는 직접적인 방식을 쓸 수 있어요. 대용량 데이터를 잘게 쪼개지 않아도 되죠.
대표 사용 사례
- 장문 텍스트: 큰 말뭉치 요약, Q&A.
- 다이얼로그: 대화 전체를 넣고 다중턴 처리.
- 비디오: 비디오 Q&A, 캡션, 메모리(Astra).
- 오디오: 실시간 전사·번역, 미팅 요약.
이런 '원샷(one-shot)에서 매니샷(manyshot) 인컨텍스트 러닝'으로 확장하는 것도 Long Context가 연 여지예요.
최적화
비용이 문제라면 **컨텍스트 캐싱(context caching)**으로 자주 쓰는 대용량 컨텍스트를 재사용해 비용을 아낄 수 있어요. RAG 프레임워크 없이도 파일을 캐시에 넣고 반복 조회가 가능해집니다.