Managed Deep Agents 평가하기
Managed Deep Agents 평가하기
코딩 에이전트와 eval-engineering 스킬로 Managed Deep Agents용 Harbor 평가를 개발할 수 있어요.
Managed Deep Agents 평가는 Harbor 작업입니다. eval-engineering 스킬이 있는 코딩 에이전트를 사용해 프로젝트를 검사하고, 검토용 Task Spec을 초안하고, evals/ 아래에 완전한 작업을 작성하세요.
Managed Deep Agents는 Harbor 워크스페이스를 초기화합니다. Harbor는 격리된 환경에서 관리형 에이전트를 각 작업에 대해 실행하고 결과를 기록합니다.
Managed Deep Agents는 공개 베타 상태이며 LangSmith Cloud의 미국 지역에서만 사용할 수 있어요.
출처: 문서
본문
사전 요구사항 (Prerequisites)
평가하기 전에 다음이 있는지 확인하세요:
mda init으로 만든 Managed Deep Agents 프로젝트 또는 에이전트 진입점이 있는 기존 프로젝트.- 고정된 Harbor 버전과 플러그인을 실행하는
uv. - 작업 환경에 Harbor가 사용하는 Docker.
- 코딩 에이전트. Agent Skills를 지원하는 에이전트는
eval-engineering을 직접 설치할 수 있습니다. 다른 에이전트의 경우 세션에 스킬 지시사항을 제공하세요.
eval-engineering 스킬 추가하기 (Add the eval-engineering skill)
eval-engineering 스킬은 코딩 에이전트가 에이전트를 발견하고, Task Spec을 제안하고, 검토된 Harbor 작업을 구축하도록 안내합니다. 현재 프로젝트에 추가하려면 실행하세요:
npx skills add langchain-ai/langchain-skills --skill eval-engineering --yes
어떤 코딩 에이전트든 사용할 수 있습니다.
Deep Agents Code(
dcode)를 사용하려면 다음으로 설치하세요:
curl -LsSf https://langch.in/dcode | bash
공급자 설정과 대화형 사용은 Deep Agents Code quickstart를 참고하세요.
코딩 에이전트로 평가 개발하기 (Develop evals with a coding agent)
평가 워크스페이스 초기화하기 (Initialize the eval workspace)
프로젝트 루트에서 실행합니다:
npx mda evals init -i
pnpm exec mda evals init -i
bunx mda evals init -i
대화형 핸드오프는 Deep Agents Code, Claude Code, Codex, Cursor를 포함한 감지된 코딩 에이전트를 나열합니다. 에이전트를 선택하면 프로젝트 디렉터리에서 해당 에이전트가 시작되고 eval-engineering 프롬프트가 실행됩니다. 다른 에이전트의 프롬프트를 복사하거나 종료하고 나중에 돌아올 수도 있습니다.
초기화는 다음을 만듭니다:
my-agent/
├── evals/
│ └── harbor-job.json
└── .mda/
└── evals/
├── runtime.json
└── harbor-adapter/
evals/harbor-job.json은 사용자 소유입니다. Managed Deep Agents는 그것이 없을 때만 작성하므로 이후 편집이 보존됩니다. .mda/evals/ 아래의 파일은 생성됩니다.
코딩 에이전트 세션 시작하기 (Start the coding-agent session)
핸드오프는 선택한 코딩 에이전트에게 eval-engineering 스킬을 설치하고 프로젝트에 사용하도록 요청합니다. 이미 스킬을 추가했다면 해당 세션에서 계속합니다.
코딩 에이전트에게 스킬의 검토 흐름을 따르고 Managed Deep Agents 작업 레이아웃을 사용하도록 요청하세요:
<Prompt description="Develop Harbor evals with the eval-engineering skill" icon="flask" actions={["copy"]}>
Use the eval-engineering skill to develop Harbor evals for this Managed
Deep Agent. Inspect the project and existing evals first. Draft the Task
Spec and wait for my review before implementing the approved task directly
under {'evals/
코딩 에이전트와 함께 Task Spec, 작업 지시사항, 환경, 검증기, 재사용 가능한 프로젝트 지식을 검토하세요. 코딩 에이전트는 설계를 승인한 후 실행 가능한 작업을 작성합니다.
Harbor 작업 검토하기 (Review the Harbor task)
지시사항과 테스트를 포함하는 evals/의 각 직접 자식은 Harbor 작업입니다:
evals/
├── harbor-job.json
└── <task>/
├── Task.md
├── instruction.md
├── task.toml
├── environment/
│ └── Dockerfile
└── tests/
├── test.sh
└── <verifier>
Task.md는 인간 검토 사양입니다. instruction.md는 에이전트에게 무엇을 해야 하는지 알려줍니다. Harbor는 작업 환경을 구축하고, 관리형 에이전트를 실행한 다음 tests/test.sh를 실행합니다. 검증기는 숫자 보상을 /logs/verifier/reward.txt에 또는 숫자 지표를 /logs/verifier/reward.json에 기록합니다.
전체 작업 형식은 Harbor 작업 문서를 참고하세요.
평가 실행하기 (Run the evals)
코딩 에이전트 핸드오프에는 프로젝트와 현재 셸에 맞게 구성된 명령이 포함됩니다. 프로젝트 루트에서 해당 명령을 실행하세요.
macOS 또는 Linux에서는 다음 형식입니다:
HARBOR_LANGSMITH_DATASET=mda-my-agent-evals \
PYTHONPATH=.mda/evals/harbor-adapter \
uv run --env-file .env --python 3.12 --with 'harbor[langsmith]==0.21.0' harbor run \
--config evals/harbor-job.json --yes \
--plugin mda_harbor.job_plugin:MDAJobPlugin \
--plugin mda_harbor.langsmith_plugin:LangSmithPlugin
my-agent를 프로젝트 디렉터리 이름으로 바꾸세요. 생성된 명령은 이름을 채우고 Windows에서는 PowerShell 구문을 사용합니다.
에이전트를 편집한 후 명령을 다시 실행하면 프로젝트 변경 사항이 반영됩니다.
결과 검사하기 (Inspect the results)
Harbor 결과를 엽니다:
uv run --python 3.12 --with 'harbor[langsmith]==0.21.0' \
harbor view .mda/evals/jobs
코딩 에이전트와 함께 실패한 시도를 검토하세요. 평가가 의도한 동작을 측정하지 않으면 작업 또는 검증기를 업데이트하세요. 평가가 제품 실패를 드러내면 관리형 에이전트를 업데이트한 다음 같은 Harbor 명령을 다시 실행하세요.
Harbor 작업 편집하기 (Edit the Harbor job)
evals/harbor-job.json을 편집해 데이터셋, 시도, 동시성, 환경 설정 또는 에이전트 환경 변수를 변경하세요. Managed Deep Agents는 mda evals init을 다시 실행할 때 파일을 보존합니다.
LangSmith에 실행 기록하기 (Record runs in LangSmith)
LANGSMITH_API_KEY를 사용할 수 있으면 LangSmith 플러그인이 HARBOR_LANGSMITH_DATASET으로 이름이 지정된 데이터셋에 Harbor 실행을 기록합니다.
참고 (See also)
- CLI 참조:
mda evals init및 관련 플래그를 검토합니다. - 에이전트 배포: 평가를 통과한 후 에이전트를 배포합니다.
- Deep Agents Code quickstart:
dcode를 설치하고 실행합니다. - Harbor 통합: Harbor 작업을 LangSmith에 기록합니다.
- Harbor 작업 문서: 작업, 환경, 검증기를 구성합니다.
더 알아보기 (Learn more)
- 이 문서들을 사용하기 — MCP를 통해 Claude, VSCode 등에 연결하여 실시간 답변을 받아 보세요.
- GitHub에서 이 페이지 편집 또는 이슈 등록