코딩 에이전트용 MCP 서버

코딩 에이전트용 MCP 서버 (MCP Server for Coding Agents)

Cursor, Claude Code, Codex 등 코딩 에이전트를 MCP로 여러분의 프로젝트에 연결하는 방법을 설명하는 문서예요. 이 문서에서는 서버 URL 선택, 클라이언트별 연결 방법, 프로젝트 선택, 그리고 노출되는 75개 도구들을 정리해 볼게요.

출처: 문서

본문

개요 (Overview)

Confident AI MCP 서버는 Model Context Protocol을 통해 코딩 에이전트를 Confident AI 프로젝트에 연결해서, 에디터를 떠나지 않고도 리소스를 제어할 수 있게 해줘요:

  • 프롬프트 버전 관리와 평가 데이터셋
  • 클라우드 평가, 지표, 지표 컬렉션
  • 프로덕션 트레이싱과 관측성
  • 인간 어노테이션과 어노테이션 큐
  • 분석 대시보드
  • 위험 평가와 거버넌스 폴리시

MCP 서버가 노출하는 모든 것은 웹 UI에서도 사용할 수 있어요. AWS 콘솔 대 AWS CLI를 생각하면 돼요. 같은 리소스, 다른 인터페이스죠. DeepEval을 쓴다면, 이 기능이 이미 평가 결과를 저장하고 있는 백엔드를 Cursor, Claude Code, Windsurf에 직접 가져다 줘요.

이걸 여러분의 MCP 서버 연결과 혼동하지 마세요. 그쪽은 애플리케이션의 도구를 Confident AI에 알려서 에이전트가 그 도구를 어떻게 쓰는지 평가할 수 있게 하는 방향이에요. 이 페이지는 반대 방향 — 에이전트를 Confident AI에 연결하는 거예요.

더 많은 제어가 필요하신가요?

MCP 서버는 에디터에서 손이 닿는 리소스를 다뤄요. 사용 가능한 전체 엔드포인트 범위는 Confident API를 직접 사용하세요.

사전 조건 (Prerequisites)

  1. Confident AI 계정.
  2. 원격 서버와 OAuth를 지원하는 MCP 클라이언트 — Cursor, Claude Code, Claude Desktop, Windsurf, 또는 Model Context Protocol을 말하는 그 어떤 것.

서버 URL

Confident AI가 MCP 서버를 호스팅해 줘요. 지역에 맞는 URL을 고르면 돼요:

지역 MCP 서버 URL
US (기본) https://mcp.confident-ai.com/mcp
EU https://eu.mcp.confident-ai.com/mcp
자체 호스팅 배포 환경의 자체 /mcp URL

아래 예시는 US URL을 사용해요. 해당 지역이라면 EU URL로 바꾸고, 자체 호스팅하고 있다면 자체 URL을 사용하면 돼요.

클라이언트 연결

인증은 OAuth예요. 클라이언트가 서버에 처음 도달하면 브라우저 창이 열리면서 Confident AI에 로그인하고 연결을 승인해요. 클라이언트는 결과 토큰을 저장하고 스스로 갱신하므로, 다시 인증할 필요는 없어요.

Cursor

.cursor/mcp.json 파일에 다음을 추가해요:

{
  "mcpServers": {
    "Confident AI MCP": {
      "url": "https://mcp.confident-ai.com/mcp"
    }
  }
}

그 다음 Cursor Settings → MCP를 열고 서버에서 Authenticate를 눌러 브라우저로 로그인을 마치면 돼요.

Claude Code

터미널에서 다음을 실행해요:

claude mcp add --transport http confident-ai https://mcp.confident-ai.com/mcp

그 다음 Claude Code 안에서 /mcp를 실행하고 서버를 골라 브라우저에서 인증해요.

Claude Desktop

Claude Desktop은 설정 파일 대신 UI로 연결해요:

  1. Settings → Connectors를 열어요.
  2. Add custom connector를 클릭해요.
  3. 이름(예: Confident AI)을 지정하고 URL로 https://mcp.confident-ai.com/mcp를 붙여 넣어요.
  4. Connect를 클릭한 다음 열리는 브라우저 창에서 로그인을 마치면 돼요.

Windsurf

Windsurf MCP 설정에 다음을 추가해요:

{
  "mcpServers": {
    "Confident AI MCP": {
      "serverUrl": "https://mcp.confident-ai.com/mcp"
    }
  }
}

그 다음 MCP 패널을 새로고침하고 브라우저 로그인을 완료해요.

stdio만 지원하는 클라이언트나 OAuth 핸드셰이크를 직접 못 돌리는 클라이언트를 쓰고 있나요? mcp-remote로 브리지하면 돼요. 서버 URL을 유일한 인자로 명령으로 실행하면, 클라이언트를 대신해 브라우저 로그인을 처리해 줘요.

프로젝트 선택

모든 도구는 필수 project_id를 요구해요. 단, list_projects는 에이전트가 사용 가능한 id를 발견하는 도구라서 예외예요.

실제로 id를 직접 타이핑할 일은 없어요. 에이전트에게 프로젝트 이름으로 작업하라고 하면, 에이전트가 먼저 list_projects를 호출해 이름을 대조하고 그 id를 세션 동안 재사용해요:

List my Confident AI projects, then pull the latest traces from the production one.

list_projects는 각 프로젝트의 id, name, description, 조직, 거버넌스 폴리시를 반환해요. 에이전트가 이 정보로 프로젝트를 구분하거나, 이름이 모호할 때 어느 것을 의도했는지 여러분에게 물어볼 수 있어요.

사용 가능한 도구 (Available Tools)

서버는 13개 영역에 걸쳐 75개 도구를 노출해요.

프로젝트 — 1개 도구

이 연결이 작업할 수 있는 프로젝트를 발견해요. 다른 모든 도구가 project_id를 필요로 하니 여기서 시작하세요.

도구 설명
list_projects 계정이 접근할 수 있는 프로젝트를 id와 메타데이터와 함께 나열해요

프롬프트 — 11개 도구

완전한 버전 관리를 갖춘 프롬프트 템플릿 관리 — pull, push, version, branch, interpolate.

도구 설명
pull_prompt alias, version, label, 또는 commit hash로 프롬프트를 가져와요
push_prompt 프롬프트 템플릿을 만들거나 업데이트해요
interpolate_prompt 플레이스홀더를 값으로 치환해 프롬프트 템플릿을 로컬에서 렌더링해요
create_prompt_version 특정 프롬프트 커밋에 버전 문자열을 할당해요
list_prompt_versions 프롬프트의 모든 형식 버전을 나열해요
list_prompt_commits 프롬프트의 전체 커밋 이력을 나열해요
list_prompts 프로젝트의 모든 프롬프트를 나열해요
list_prompt_branches 프롬프트의 모든 브랜치를 나열해요
create_prompt_branch main의 head 커밋에서 분기하는 브랜치를 만들어요
update_prompt_branch 브랜치 이름을 바꿔요 (main은 보호됨)
delete_prompt_branch 브랜치를 삭제해요 (열린 pull request가 있으면 차단됨)

데이터셋 — 11개 도구

개별 골든까지 평가 데이터셋을 pull, 편집, 버전 관리 — 실행을 고정할 불변 스냅샷 포함.

도구 설명
pull_dataset alias로 데이터셋(단일 턴 또는 다중 턴)을 가져와요, 선택적으로 버전에 고정
push_dataset 새 골든을 추가해 데이터셋을 만들거나 업데이트해요, 선택적으로 특정 버전에
list_datasets 프로젝트의 모든 데이터셋을 나열해요
delete_dataset 데이터셋과 모든 골든·버전을 영구 삭제해요
create_dataset_version 현재 데이터셋 상태를 새 불변 버전으로 스냅샷해요
list_dataset_versions 데이터셋의 모든 버전을 최신순으로 나열해요
create_golden 단일 골든을 데이터셋에 추가해요, 선택적으로 특정 버전에
get_golden 커스텀 컬럼과 태그를 포함한 모든 필드로 단일 골든을 가져와요
update_golden 골든의 필드를 교체해요 (전체 교체)
delete_golden 단일 골든을 영구 삭제해요
queue_goldens 필요하면 데이터셋을 만들며 확정되지 않은 골든을 어노테이션용으로 큐에 넣어요

평가(Evaluate) — 2개 도구

클라우드 평가를 트리거하고 다중 턴 대화를 시뮬레이션해요.

도구 설명
run_llm_evals 테스트 케이스 배치에 대해 지표 컬렉션을 기준으로 클라우드 평가를 실행해요
simulate_conversation 시나리오와 기대 결과에서 다중 턴 대화의 다음 턴을 시뮬레이션해요

트레이스, 스레드, 스팬 — 9개 도구

LLM 파이프라인의 모든 수준에서 프로덕션 관측성 데이터를 탐색, 검사, 평가해요.

도구 설명
list_traces 환경, 시간 범위, 정렬 순서로 필터링하며 트레이스를 나열해요
get_trace 모든 스팬을 포함한 트레이스의 전체 상세를 가져와요
list_threads 필터링과 페이지네이션으로 대화 스레드를 나열해요
get_thread 모든 트레이스와 스레드 수준 지표를 포함한 스레드의 전체 상세를 가져와요
list_spans 유형, 오류 상태, 프롬프트 버전 등으로 필터링하며 스팬을 나열해요
get_span I/O, 비용, 지표, 어노테이션을 포함한 스팬의 전체 상세를 가져와요
evaluate_trace 트레이스에 대한 클라우드 평가를 트리거해요
evaluate_thread 대화 스레드에 대한 클라우드 평가를 트리거해요
evaluate_span 스팬에 대한 클라우드 평가를 트리거해요

어노테이션 — 4개 도구

트레이스, 스팬, 스레드에 대한 인간 피드백을 만들고 관리해요.

도구 설명
list_annotations 대상, 유형, 평점 범위로 필터링하며 어노테이션을 나열해요
get_annotation 어노테이션의 전체 상세를 가져와요
create_annotation 트레이스, 스팬, 스레드에 thumbs 또는 star 평점을 만들어요
update_annotation 어노테이션의 평점, 설명, 기대 출력을 업데이트해요

어노테이션 큐 — 10개 도구

인간 검토 작업을 정리해요: 어노테이션용으로 트레이스, 스팬, 스레드를 큐에 넣고 결과를 제출해요.

도구 설명
list_annotation_queues 완료 통계와 함께 큐를 나열해요
create_annotation_queue 트레이스, 스팬, 스레드, 골든, 테스트 실행용 큐를 만들어요
get_annotation_queue 큐의 통계와 어노테이터별 할당 내역을 가져와요
update_annotation_queue 큐 이름을 바꿔요
delete_annotation_queue 큐와 그 항목을 삭제해요 (제출된 어노테이션은 유지)
add_items_to_annotation_queue 참조로 트레이스, 스팬, 스레드를 큐에 넣어요 (중복은 건너뜀)
list_annotation_queue_items 큐의 항목을 오래된 순으로 나열해요, 완료 여부로 필터 가능
get_next_annotation_queue_item 다음 대기 중 항목을 전체 기본 데이터와 함께 가져와요
annotate_queue_item 한 항목에 대해 어노테이션 및/또는 커스텀 폼 응답을 제출해요
batch_annotate_queue_items best-effort 호출 한 번으로 많은 항목을 어노테이션해요

테스트 실행 — 2개 도구

과거 평가 실행과 그 결과를 검사해요.

도구 설명
list_test_runs 상태, 시간 범위, 다중 턴 유형으로 필터링하며 테스트 실행을 나열해요
get_test_run 테스트 케이스별 지표 점수와 추론을 포함한 테스트 실행의 전체 상세를 가져와요

지표 — 6개 도구

커스텀 LLM-as-a-judge 지표를 정의·관리하고 온라인 평가 결과를 읽어요.

도구 설명
list_metrics 기준과 필수 파라미터와 함께 모든 커스텀 지표를 나열해요
get_metric 이름으로 단일 지표를 가져와요
create_metric 기준 또는 평가 단계에서 지표를 만들어요, 선택적으로 루브릭 포함
batch_create_metrics 한 번의 호출로 여러 지표를 만들어요 (기존 이름은 건너뜀)
update_metric 지표의 기준, 단계, 파라미터, 루브릭을 업데이트해요
list_metric_data 시간 범위 필터가 있는 페이지네이션으로 온라인 평가 결과를 나열해요

지표 컬렉션 — 3개 도구

지표를 컬렉션으로 묶어요 — 클라우드 평가가 실행되는 단위예요.

도구 설명
list_metric_collections 지표와 임계값을 포함한 모든 지표 컬렉션을 나열해요
create_metric_collection 기존 지표에서 지표별 설정과 함께 컬렉션을 만들어요
update_metric_collection 컬렉션 이름을 바꾸거나 지표 설정을 교체해요

대시보드 — 11개 도구

분석 대시보드를 만들고 조회해요. 위젯 작성 도구는 차트 유형, 데이터 모델, 집계, 차원, 필터를 포함한 전체 구성 가이드를 담고 있어서 에이전트가 의미 있는 대시보드를 만들 수 있고, preview_widget은 저장 전에 위젯의 데이터를 확인하게 해줘요.

도구 설명
list_dashboards 위젯 수와 함께 모든 대시보드를 나열해요
create_dashboard 대시보드를 만들어요, 선택적으로 한 번의 호출로 위젯 포함 (자동 레이아웃)
get_dashboard 모든 위젯 정의와 함께 대시보드를 가져와요
update_dashboard 대시보드의 이름, 설명, 공개 범위를 업데이트해요
delete_dashboard 대시보드를 영구 삭제해요
add_dashboard_widget 대시보드에 위젯을 추가해요 (자동 배치)
update_dashboard_widget 위젯의 정의를 교체해요 (라인 포함 전체 교체)
delete_dashboard_widget 대시보드에서 위젯을 제거해요
query_dashboard 대시보드의 위젯을 실행하고 그 데이터를 반환해요
query_dashboard_widget 단일 위젯을 실행하고 그 데이터를 반환해요
preview_widget 저장 없이 위젯 정의를 실행해요 — 커밋 전에 반복해요

위험 평가 — 3개 도구

LLM 애플리케이션을 설정된 프레임워크에 대해 레드팀해요. Enterprise 플랜이 필요해요.

도구 설명
list_risk_assessment_frameworks 위험 카테고리와 공격 커버리지와 함께 프레임워크를 나열해요
run_risk_assessment_framework 프롬프트 또는 AI 연결에 대해 비동기 레드팀 실행을 보내요
create_risk_assessment 외부에서 실행된 레드팀 실행을 전체 결과와 함께 업로드해요

AI 연결과 거버넌스 — 2개 도구

등록한 LLM 엔드포인트에 닿고, 프로젝트를 거버넌스 폴리시에 대해 확인해요.

도구 설명
list_ai_connections 등록된 LLM 앱 엔드포인트를 나열해요, 시뮬레이션과 위험 평가에 사용
assess_governance 프로젝트의 거버넌스 폴리시 컨트롤을 다시 실행하고 각 상태를 보고해요

이 도구들 중 상당수는 데이터셋, 골든, 프롬프트 브랜치, 대시보드, 위젯, 어노테이션 큐 같은 데이터를 영구 삭제해요. MCP 서버를 통째로 허용 목록에 넣기보다는 클라이언트의 호출별 승인 프롬프트를 켜두세요.

자체 호스팅 배포 (Self-Hosted Deployments)

자체 클라우드 계정에서 Confident AI를 운영한다면, MCP 서버는 배포와 함께 제공되고 호스팅 엔드포인트 대신 여러분의 인스턴스와 통신해요. 트레이스, 프롬프트, 평가 데이터가 인프라를 벗어나지 않아요. 클라이언트를 호스팅 URL 대신 배포의 /mcp URL에 연결하면 되고, 이 페이지의 다른 모든 내용은 동일해요.

로그인도 같은 경로를 따릅니다. MCP 서버는 여러분 배포의 백엔드를 인가 서버로 광고하므로, OAuth 플로우가 완전히 여러분의 인스턴스에 대해서만 실행돼요.

자체 호스팅 배포가 어떻게 구성되는지는 self-hosting을, 전체 보안 모델은 보안과 컴플라이언스를 참고해요.

다음 단계

에이전트 스킬 (Agent Skills)

MCP 서버를 공식 deepeval, confident-tracing, confident-otel, confident-client 스킬과 함께 사용해서, 에이전트가 리소스뿐 아니라 워크플로도 알게 해요.

스킬 살펴보기

커스텀 에이전트 스킬 (Custom Agent Skills)

Claude Code, Codex, Cursor 등 코딩 에이전트에 프로젝트별 온보딩 지침을 제공해요.

가이드 읽기

더 알아보기