민감 데이터를 위한 맞춤 카테고리를 만들어요.

민감 데이터를 위한 맞춤 카테고리를 만들어요.


Enterprise Edition Feature

민감 데이터 분류에는 Enterprise Edition 이상이 필요해요. 업그레이드에 대해 문의하려면 Snowflake Support에 연락해 주세요.

도메인별 민감 데이터를 감지하는 native semantic category가 없다면, 민감 데이터를 위한 사용자 지정 카테고리를 만들 수 있어요.

사용자 지정 분류기를 정의하여 사용자 지정 의미 카테고리를 구현해요. 사용자 지정 분류기에는 다음과 같은 속성이 있어요:

  • 예를 들어 medical_code 및 employee_id와 같은 데이터 유형을 식별하는 사용자 지정 의미 카테고리.

  • Snowflake의 알고리즘이 민감 데이터를 감지하는 데 사용하는 정규 표현식.

  • 사전 정의된 개인정보 보호 카테고리 중 하나.


출처: 문서

본문


작동 방식

Snowflake는 SNOWFLAKE.DATA_PRIVACY 스키마에서 CUSTOM_CLASSIFIER class를 제공해요. 데이터 엔지니어가 자신의 데이터에 대한 지식을 바탕으로 데이터 분류 기능을 확장할 수 있도록 하기 위해서예요. 클래스의 인스턴스를 만든 후에는 인스턴스에서 메서드를 호출하여 사용자 지정 의미 범주를 정의하고, 개인 정보 보호 범주를 지정하고, 열 이름을 선택적으로 일치시키면서 열 값 패턴과 일치하는 정규식을 지정할 수 있어요.

중요

민감한 데이터 분류는 사용자 지정 분류기의 정의를 저장하며, 참조를 저장하지 않아요. 사용자 지정 분류기를 변경하는 경우 SET_CUSTOM_CLASSIFIERS 메서드를 사용하여 새 정의로 분류 프로필을 업데이트해야 해요.

CUSTOM_CLASSIFIER 클래스를 사용하여 사용자 지정 분류기를 만들고 사용하는 예시는 Example을 참조하세요.

고려 사항

분류하려는 데이터 크기에 맞는 웨어하우스를 선택하세요:

  • 처리 시간에 대한 우려가 없는 경우: x-small 웨어하우스.

  • 테이블에 최대 100개의 열: small 웨어하우스.

  • 테이블에 101~300개의 열: medium 웨어하우스.

  • 테이블에 300개가 넘는 열: large 웨어하우스.

사용자 지정 범주의 임계값

사용자 지정 범주를 분류하는 데 사용되는 알고리즘은 점수 규칙을 사용하여 사용자 지정 분류기의 정규식을 평가하고, 권장할 의미 범주를 결정해요.

점수 규칙은 기본 임계값 0.8을 사용해요. 이는 권장 범주가 무엇이어야 하는지에 대한 높은 신뢰도를 의미해요. 샘플 데이터의 80%가 인스턴스에 추가한 정규식과 일치해야 해요. 알고리즘은 열의 점수를 임계값과 비교하고 다음 중 하나에 해당하는 범주를 권장해요:

  • 비국제 시스템 태그

  • 국제 시스템 태그

  • 사용자 지정 분류기 태그

사용자 지정 분류 인스턴스의 임계값은 인스턴스에서 custom_classifier!ADD_REGEX 메서드를 호출하여 지정할 수 있어요.

참고

두 사용자 지정 분류기가 동일한 점수를 가질 수 있어요. 이 경우 동점은 다음을 평가하여 해결해요:

  • 각 사용자 지정 범주 간의 일치 비율.

  • 사용자 지정 범주 이름 간의 알파벳순.

이 경우 승리한 범주가 권장 범주가 되고, 나머지는 대체 범주에 포함돼요.

다음 표는 점수 알고리즘과 권장 태그를 요약한 것이에요:

이름 매처 제공 값 일치 >= 임계값 이름 일치 권장 사항
True True True 사용자 지정 범주
False True Snowflake 범주
True False Snowflake 범주
False False Snowflake 범주
False True 해당 없음 사용자 지정 범주
False 해당 없음 Snowflake 범주

복제 및 클로닝

  • CUSTOM_CLASSIFIER 클래스의 인스턴스는 데이터베이스를 복제할 때 복제돼요.

  • CUSTOM_CLASSIFIER 클래스의 인스턴스는 인스턴스가 포함된 스키마를 클로닝할 때 클로닝돼요.


더 알아보기 (Learn more)