Safety best practices — 모더레이션·적대적 테스트·HITL

Safety best practices — 모더레이션·적대적 테스트·HITL

안전한 배포를 위해 OpenAI는 모더레이션, 적대적 테스트, 인간 감독(HITL) 등을 함께 쓰라고 조언해요.

모더레이션

무료 Moderation API로 불안전한 콘텐츠 발생 빈도를 낮출 수 있어요. 자체 필터를 만들거나, Responses/Chat Completions 요청에서 모더레이션 점수를 함께 요청할 수도 있어요.

적대적 테스트

제품을 넓은 입력·사용자 행동 범위에서 테스트해요. "이전 지시를 무시하고 이렇게 해라" 같은 프롬프트 인젝션으로 쉽게 리다이렉트되는지 확인하는 것도 포함돼요.

인간 감독(HITL)

가능한 곳에서 실제 사용 전에 인간이 출력을 검토하게 해요. 검증된 자료 집합에서만 출력을 돌려보내는(routing) 방식은 임의 생성보다 안전할 수 있어요.

입력·출력 제약

입력 길이를 제한해 인젝션을 줄이고, 출력 토큰을 제한해 오용 가능성을 낮춰요. 신뢰 소스의 드롭다운 필드처럼 좁은 입력 범위가 안전해요. 안전 식별자(safety identifier)를 보내 남용을 모니터링할 수도 있어요.

더 알아보기