추론 능력(Reasoning Capabilities)
추론 능력(Reasoning Capabilities)
추론 모델은 도구 사용, 에이전트형 워크플로, 복잡한 문제 해결에서 뛰어나요. 이 페이지는 Cohere의 추론 능력에 대한 전반적인 개요를 제공합니다.
출처: 문서
본문
추론 모델은 더 정교한 문제 해결 능력을 가능하게 하는 고급 AI 접근 방식을 나타내요. Cohere의 추론 모델은 하이브리드 방식이라, 추론을 활성화할 수 있고(이 경우 최종 응답을 내놓기 전에 내부 추론 과정을 생성) 비활성화할 수도 있습니다(이 경우 다른 LLM과 똑같이 동작).
추론 모델은 어떻게 동작하나요?
추론 모델이 요청을 처리할 때, 먼저 내부적으로 문제를 단계별로 분해해 작업해요. 이 추론 과정은 모델이 분석, 계획, 논리적 단계를 진행하는 전용 "thinking" 콘텐츠 블록에서 일어납니다. 내부 추론을 완료한 후에야 모델은 최종 텍스트 응답을 생성하며, 이를 통해 더 깊은 분석으로 복잡한 작업을 처리할 수 있어요.
핵심 이점은 추론 모델이 지원되는 23개 언어에서 도구 활용과 에이전트형 문제 해결 같은 복잡한 문제를, 먼저 내부적으로 해결한 다음 잘 추론된 해결책을 제시할 수 있다는 점이에요. 이 접근 방식은 더 정확하고 철저한 응답을 이끌어내면서, 모델이 해결할 수 있는 문제 복잡성의 경계를 넓혀줍니다.
시작하기(Getting Started)
추론 능력을 가진 모델은 Chat API를 통해 접근할 수 있어요. 다음은 그 예시입니다:
PYTHON
from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
prompt = """
Alice has 3 brothers and she also has 2 sisters. How many sisters does Alice's brother have?
"""
response = co.chat(
model="command-a-reasoning-08-2025",
messages=[
{
"role": "user",
"content": prompt,
}
],
)
for content in response.message.content:
if content.type == "thinking":
print("Thinking:", content.thinking)
if content.type == "text":
print("Response:", content.text)
PYTHON (Streaming)
from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
prompt = """
Alice has 3 brothers and she also has 2 sisters. How many sisters does Alice's brother have?
"""
response = co.chat_stream(
model="command-a-reasoning-08-2025",
messages=[
{
"role": "user",
"content": prompt,
}
],
)
for event in response:
if event.type == "content-delta":
if event.delta.message.content.thinking:
print(event.delta.message.content.thinking, end="")
if event.delta.message.content.text:
print(event.delta.message.content.text, end="")
Curl
curl --request POST \
--url https://api.cohere.ai/v2/chat \
--header 'accept: application/json' \
--header 'content-type: application/json' \
--header "Authorization: bearer ***" \
--data '{
"model": "command-a-reasoning-08-2025",
"messages": [
{
"role": "user",
"content": "Alice has 3 brothers and she also has 2 sisters. How many sisters does Alice'\''s brother have?"
}
]
}'
추론 능력 활성화/비활성화
추론 모델의 경우 thinking은 기본적으로 활성화되어 있어요. 비활성화하려면 "thinking" 파라미터에 다음 값을 보내면 됩니다:
PYTHON
thinking={
"type": "disabled" # turns off thinking. It is set to "enabled" by default.
}
Thinking 예산(Thinking Budgets)
모델이 생성할 수 있는 thinking 토큰 수의 상한을 설정하기 위해 thinking 토큰 예산(token budget)을 지정할 수도 있어요. 우리의 권장 사항은 무제한 thinking(즉 reasoning = on)을 사용하는 것입니다. 하지만 thinking 예산을 사용할 계획이라면 응답을 위해 최소 1K 토큰을 남겨두도록 하세요. 예를 들어 모델이 최대 한도까지 추론하길 원한다면 31K를 토큰 예산으로 권장해요.
예산을 초과하면 모델은 즉시 최종 응답을 진행합니다.
PYTHON
thinking = {
"token_budget": 500 # limits the model's thinking output to at most 500 tokens
}
사용 사례 및 응용(Use Cases and Applications)
추론 모델은 단계별 분석의 이점을 얻는 작업에서 뛰어나요, 여기에는 다음이 포함됩니다:
- 에이전트형 사용 사례: 자율적으로 행동하고 환경과 상호작용하며 문제를 해결하는 작업.
- 도구 사용(Tool Use): 검색 엔진, API 등 다양한 도구를 활용할 수 있음.
- 다국어(Multilingual): 다국어 입력에 대해 추론할 수 있으며, 23개 언어로 된 사용자 질의를 지원할 수 있음.
기술 구현(Technical Implementation)
추론 과정은 개발자가 다음을 할 수 있게 해주는 특정 파라미터를 통해 제어됩니다:
- 추론 능력 활성화 또는 비활성화
- 추론 깊이를 제어하는 토큰 예산 설정
- 실시간으로 추론과 최종 답변을 볼 수 있는 응답 스트리밍
이 아키텍처는 높은 정확도, 추론의 투명성, 그리고 체계적인 분석의 이점을 받는 복잡하고 다면적인 문제를 처리하는 능력이 요구되는 애플리케이션에 특히 유용하게 만듭니다.