레드 팀링 퀵스타트(Red Teaming Quickstart) — 노코드

레드 팀링 퀵스타트(Red Teaming Quickstart) — 노코드

AI 애플리케이션을 코드 한 줄 없이 위험 평가하고 싶다면 노코드 퀵스타트가 가장 빠른 길이에요. 플랫폼 UI에서 AI 앱을 연결하고, 보안 프레임워크를 구성한 뒤, 첫 위험 평가를 실행하고 대시보드에서 결과를 확인하기까지를 따라 해볼게요.

출처: 문서

본문

개요

이 퀵스타트는 Confident AI에서 첫 노코드 위험 평가를 실행하는 과정을 안내해요. 이 가이드를 끝내면 다음을 갖추게 돼요:

  • AI 앱을 Confident AI에 연결
  • 첫 보안 프레임워크 구성
  • AI 애플리케이션에 대한 위험 평가를 실행하고 대시보드에서 확인

노코드 위험 평가를 쓰면 어떤 팀 구성원이든 Confident AI 플랫폼에서 직접 AI 애플리케이션을 보안·규정 준수 관점으로 분석할 수 있어요.

동작 방식(How it works)

위험 평가는 간단한 4단계 프로세스를 따라요:

  1. AI 애플리케이션 연결 — Confident AI가 시스템과 통신할 수 있도록 AI Connection을 구성.
  2. 보안 프레임워크 정의 — 원하는 취약점과 공격을 담은 프레임워크(예: OWASP Top 10 for LLMs, MITRE ATLAS)를 선택하거나 생성.
  3. 공격 생성 및 실행 — 적대적 입력을 자동 생성해 AI 애플리케이션으로 전송.
  4. 평가 및 위험 평가 — Confident AI가 응답을 분석하고 성공적인 악용을 탐지하며 구조화된 위험 평가 보고서를 생성.

AI 앱은 인터넷으로 접근 가능한 어떤 애플리케이션이든 돼요. Confident AI는 구성한 AI Connection을 통해 그 앱과 직접 통신해요.

위험 평가 중 데이터 흐름을 시각적으로 보면:

sequenceDiagram
    participant User as You
    participant Platform as Confident AI
    participant Framework as Security Framework
    participant AI as Your AI App

    User->>Platform: Start Risk Assessment

    Platform->>Framework: Load vulnerabilities & attacks

    loop For each vulnerability and attack
        Framework-->>Platform: Generate adversarial input
        Platform->>AI: Send attack (adversarial input)
        AI-->>Platform: Return response
        Platform->>Framework: Evaluate response (jailbreak? policy violation?)
        Framework-->>Platform: Risk result
    end

    Platform-->>User: Risk Assessment Report Generated
    Note over User,Platform: View CVSS score, vulnerabilities, attack surface

첫 위험 평가 실행(Run your first risk assessment)

따라 하려면 Confident AI 계정이 필요해요. 아직 없다면 여기서 가입하면 돼요.

AI 앱 연결(Connect Your AI App)

먼저 Confident AI가 내 앱과 통신할 수 있도록 AI Connection을 설정해요.

AI Connection 설정하기

  1. Project Settings → AI Connections로 이동
  2. New AI Connection 클릭
  3. 고유한 식별 이름을 지정
  4. 엔드포인트, 페이로드, 출력 키 경로(output key path)를 구성
  5. Save 클릭

프레임워크 만들기(Create a Framework)

프레임워크는 평가에서 사용될 취약점과 공격을 정의해요.

Confident AI에서 프레임워크 추가하기

  1. Frameworks 탭으로 이동
  2. Add Framework 클릭
  3. 템플릿(예: OWASP, NIST, MITRE ATLAS)을 선택하거나 커스텀 프레임워크를 생성
  4. Save 클릭

프레임워크 설정 페이지에서 언제든 취약점, 공격, 우선순위를 편집할 수 있어요.

평가 실행(Run the Assessment)

프레임워크 설정 페이지에서 Run Assessment를 클릭하고 테스트할 AI Connection을 선택해요.

위험 평가 만들기

Confident AI가 프레임워크에서 적대적 입력을 생성해 내 앱으로 전송해요.

평가에는 설명적인 이름을 붙이세요(예: "compliance-test-feb-11"). 나중에 찾기 쉬워요.

결과 보기(View Results)

평가가 완료되면 보고서가 위험 프로필 섹션에 표시돼요.

위험 평가 결과 보기

보고서에는 다음이 포함돼요:

  • Executive Summary — 전체 통과율, 취약점 커버리지, 중요 이슈
  • Test Cases — 모든 적대적 입력과 내 AI의 응답
  • CVSS Score & Overview — 취약점별 위험 점수 분포와 악용 가능성 분석

완료 ✅. 첫 노코드 위험 평가를 실행했어요. 전체 분석과 수정 권장사항이 담긴 PDF 보고서도 다운로드할 수 있어요.

권장 모델(Recommended Models)

레드 팀링은 적대적 입력을 생성하는데, 대부분의 AI 모델은 유해한 출력 생성을 막는 가드레일(guardrails)을 갖고 있어요. 그래서 생성 작업에는 uncensored(무검열) 또는 neutral(중립) 모델을 권장해요. 레드 팀링에 쓸 수 있는 믿을 만한 모델 목록은 다음과 같아요:

Model Params Guardrails
huihui-ai/Llama-3.3-70B-Instruct-abliterated:featherless-ai 70B Uncensored
NousResearch/Hermes-3-Llama-3.1-70B:featherless-ai 70B Neutral
huihui-ai/Qwen2.5-72B-Instruct-abliterated:featherless-ai 72B Uncensored
dphn/dolphin-2.9.2-qwen2-72b:featherless-ai 72B Uncensored
dphn/dolphin-2.9-llama3-70b:featherless-ai 70B Uncensored
huihui-ai/Mistral-Small-24B-Instruct-2501-abliterated:featherless-ai 24B Uncensored
dphn/dolphin-2.9.3-mistral-nemo-12b:featherless-ai 12B Uncensored
NousResearch/Hermes-3-Llama-3.1-8B:featherless-ai 8B Neutral
mlabonne/NeuralDaredevil-8B-abliterated:featherless-ai 8B Uncensored
huihui-ai/Qwen2.5-7B-Instruct-abliterated-v3:featherless-ai 7B Uncensored

Uncensored 모델은 안전 가드레일이 제거된 모델이고, Neutral 모델은 거부율(refusal rates)이 낮고 구조화된 출력이 가장 안정적인 최소 정렬 모델이에요. 이 모델들은 Platform Model을 Hugging Face 제공자로 설정하고 자격 증명과 함께 사용하면 쓸 수 있어요.

다른 제공자의 uncensored 모델도 쓸 수 있어요 — 예를 들어 OpenRouter의 cognitivecomputations/dolphin-mistral-24b-venice-edition, sao10k/l3.3-euryale-70b, nousresearch/hermes-3-llama-3.1-405b 같은 것들이요. Platform Model을 OpenRouter 제공자로 설정하면 돼요.

다음 단계(Next steps)

첫 위험 평가를 실행했으니 이제 플랫폼을 더 깊게 파볼게요:

프레임워크 & 정책(Frameworks & Policies)

사용 사례에 맞게 프레임워크를 커스터마이즈하고 취약점을 추가하며 공격 우선순위를 구성해요.

위험 프로필(Risk Profiles)

평가 전반의 CVSS 점수, 취약점 커버리지, 악용 가능성 분석을 이해해요.

더 알아보기