Red Teaming — 배포 전에 모델을 공격해보기
Red Teaming
평가(evals)는 '의도된 동작'을 재는 반면, Red Teaming(레드팀) 은 공격적 테스트 케이스로 '안전하지 않거나 정책을 위반하는 동작'을 배포 전에 찾아내요. 악용 사례·실패 모드·고위험 상호작용을 찔러보는 게 핵심이에요. 일반 품질 테스트로는 드러나지 않는 취약점을 드러내요.
이 카테고리의 문서
- 개요: OpenAI Red teaming — 적대적 테스트 케이스로 위험 노출
- 핵심 기능: Safety best practices — 모더레이션·적대적 테스트·HITL
- 실전·API: Moderation API — 출력 필터링 실전
출처: https://developers.openai.com/api/docs/guides/red-teaming