DeepTeam으로 레드 팀링(Red Team Using DeepTeam)
DeepTeam으로 레드 팀링(Red Team Using DeepTeam)
AI 애플리케이션의 안전과 보안을 배포 전에 점검하고 싶다면 Confident AI의 레드 팀링 기능이 제격이에요. 로컬에서 deepteam 프레임워크로 공격을 실행하거나, 플랫폼의 프리빌트 취약점 프레임워크를 활용하는 두 가지 방식이 있어요. 이 글에서는 코드 기반 레드 팀링 평가를 처음부터 끝까지 따라 해볼게요.
출처: 문서
본문
개요
Confident AI의 레드 팀링 기능은 배포 전 워크플로에서 AI 안전과 보안을 테스트할 다양한 기능을 제공해요.
- 취약점 평가(Vulnerability assessment): 편향(bias), 독성(toxicity), PII 유출, 프롬프트 인젝션 같은 약점을 체계적으로 식별해요.
- 적대적 테스트(Adversarial testing): 제일브레이킹(jailbreaking), 프롬프트 인젝션, 그 밖의 정교한 공격 방법을 사용해 실제 공격을 시뮬레이션해요.
- 위험 프로파일링(Risk profiling): 40+ 가지 취약점 유형을 아우르는 종합 평가와 상세한 위험 평가·수정 가이드를 제공해요.
DeepTeam의 모든 취약점과 공격은 Confident AI에서도 사용할 수 있어요.
로컬 레드 팀링(Local Red Teaming)
- 취약점과 공격을 완전히 제어하면서
deepteam으로 로컬에서 레드 팀링 실행 - 커스텀 취약점, 공격 방법, 고급 레드 팀링 알고리즘 지원
적합한 대상: Python 사용자, 개발, 배포 전 보안 워크플로
원격 레드 팀링(Remote Red Teaming)
- 프리빌트 취약점 프레임워크로 Confident AI 플랫폼에서 레드 팀링 실행
- 모니터링, 위험 평가, 팀 협업 기능과 통합
적합한 대상: 비-Python 사용자, 지속적인 모니터링, 운영 안전 평가
위험 평가 만들기(Create a Risk Assessment)
이 예시는 **적대적 공격(adversarial attacks)**을 사용해 AI 시스템의 취약점을 찾아내는 종합 안전 평가를 진행해요.
계속하기 전에 설정 및 설치(setup and installation) 섹션에서 안내하는 대로 API 키를 받아 두세요.
로컬에서 레드 팀링을 실행하면 공격은 내 머신에서 수행되고 결과는 Confident AI에 업로드돼요. 그래서 커스텀 취약점과 공격 방법을 완전히 제어할 수 있어요.
DeepTeam 설치(Install DeepTeam)
Confident AI의 오픈소스 레드 팀링 프레임워크인 DeepTeam을 설치해요:
pip install -U deepteam
API 키 설정(Set Your API Key)
결과가 플랫폼에 업로드되도록 Confident AI API 키를 설정해요:
deepteam login
혹은 환경 변수로 설정할 수도 있어요:
export CONFIDENT_API_KEY=YOUR-API-KEY
대상 모델 설정(Set Up Your Target Model)
AI 시스템을 모델 콜백 함수로 정의해요. 이것이 레드 팀링할 대상 AI 애플리케이션입니다.
from deepteam.test_case import RTTurn, ToolCall
async def model_callback(input: str) -> str:
# Replace this with your actual LLM application
# This could be a RAG pipeline, chatbot, agent, etc.
return RTTurn(
role="assistant",
content="Your agent's response here...",
retrieval_context=["Your retieval context here"],
tools_called=[
ToolCall(name="SearchDatabase")
]
)
model callback 은 하나의 문자열 파라미터(적대적 입력)를 받아야 하고, role이
assistant인RTTurn객체를 반환해야 해요. content에는 AI 시스템의 응답이 들어가요. RAG나 에이전트 시스템을 테스트할 때는RTTurn객체에retrieval_context와tools_called를 전달할 수도 있어요.retrieval_context는 문자열 목록이 될 수 있고,tools_called는ToolCall객체 목록이어야 해요.
보안 프레임워크 가져오기(Pull Your Security Framework)
Confident AI에서 설정해 둔 보안 프레임워크를 가져와요:
from deepteam.frameworks import RedTeamingFramework
framework = RedTeamingFramework()
framework.pull("your-framework-id")
프레임워크의 id는 설정 페이지 URL의 마지막 세그먼트예요. 프레임워크를 가져오면 모든 위험 범주와, 각 범주에 설정된 취약점 유형·공격 방법이 함께 내려와요.
레드 팀 평가 실행(Run the red team assessment)
가져온 프레임워크를 대상으로 평가를 실행해요:
from deepteam import red_team
red_team(
model_callback=model_callback,
framework=framework,
identifier="my-local-assessment",
run_all_attacks=True
)
이렇게 하면 프레임워크의 모든 위험 범주, 취약점 유형, 공격 방법에 대해 model_callback이 실행돼요. 위험 평가 결과는 콘솔에 출력되고 Confident AI에도 업로드돼요. 그러면 Confident AI 플랫폼의 Risk Profile 섹션에서 이 결과를 볼 수 있어요.
위험 평가 결과가 Confident AI 플랫폼에 업로드되려면 CLI에서
deepteam login명령을 실행하거나, API 키를 환경 변수CONFIDENT_API_KEY로 저장해 두어야 해요.
사전 정의된 프레임워크 사용하기(Using a Pre-defined Framework)
deepteam은 OWASP, NIST AI RMF, MITRE ATLAS 같은 사전 정의된 프레임워크도 함께 제공해요:
from deepteam.frameworks import OWASPTop10
from deepteam import red_team
# Run with framework
red_team(
model_callback=model_callback,
framework=OWASPTop10(),
)
결과는 Confident AI 플랫폼에 자동으로 게시돼요.
이것들은 노코드 워크플로에서 사용할 수 있는 것과 같은 프레임워크(OWASP, NIST, MITRE ATLAS)를 프로그래밍 방식으로 쓴 예시예요. Confident AI에서 커스터마이즈한 프레임워크를 로컬에서 실행하려면, 위에서 본 것처럼 가져오기(pull)를 하면 돼요.
모범 사례(Best Practices)
- 프레임워크로 시작하기(Start with frameworks): 포괄적인 커버리지를 위해 OWASP Top 10이나 NIST AI RMF를 사용해요.
- 일찍 그리고 자주 테스트하기(Test early and often): 개발 사이클에 레드 팀링을 통합해요.
- 사용 사례에 집중하기(Focus on your use case): 애플리케이션의 위험에 맞게 취약점을 커스터마이즈해요.
- 지속적으로 모니터링하기(Monitor continuously): 운영 시스템에 대한 지속적인 안전 평가를 설정해요.
- 기록하고 수정하기(Document and remediate): 발견 사항과 수정 노력에 대한 상세 기록을 남겨요.
다음 단계(Next Steps)
프레임워크 기반 테스트(Framework-Based Testing)
OWASP Top 10, NIST AI RMF 같은 업계 표준 프레임워크로 종합적인 보안 평가를 수행해요
위험 프로필 & 평가(Risk Profile & Assessments)
사용 사례와 업계 요구사항에 맞춘 커스텀 취약점과 공격 방법을 만들어요
레드 팀링은 Confident AI의 기존 LLM 평가(evaluation) 및 트레이싱(tracing) 워크플로와 원활하게 함께 동작해요.
더 알아보기
- Frameworks & Policies — 보안 프레임워크를 만들고 커스터마이즈하는 방법
- Risk Profile — 평가 결과와 CVSS 점수 해석하는 방법