DetectDuplicate 프로세서
DetectDuplicate 프로세서
Snowflake Openflow의 DetectDuplicate 프로세서에 대한 문서예요. 각 입력 FlowFile에 대해 FlowFile 속성에서 계산된 값을 캐시하고, 그 캐시 값이 이전에 보인 적이 있는지 판단하는 중복 감지 프로세서예요.
출처: Snowflake 문서
본문
기능 — 일반 제공(Generally Available)
Openflow Snowflake 배포는 AWS, Azure, GCP 상용(Commercial) 리전의 모든 계정에서 사용할 수 있어요. Openflow BYOC 배포는 AWS 상용(Commercial) 리전의 모든 계정에서 사용할 수 있어요.
번들(Bundle)
org.apache.nifi | nifi-standard-nar
설명(Description)
각 입력 FlowFile에 대해 FlowFile 속성에서 계산된 값을 캐시하고, 그 캐시 값이 이미 보인 적이 있는지 판단해요. 중복이라면 'original.identifier'라는 속성을 가진 FlowFile을 'duplicate'로 라우팅하는데, 이 속성은
태그(Tags)
dedupe, dupe, duplicate, hash
입력 요구사항(Input Requirement)
REQUIRED
민감 동적 속성 지원(Supports Sensitive Dynamic Properties)
false
속성(Properties)
| 속성(Property) | 설명(Description) |
|---|---|
| Age Off Duration | 캐시된 FlowFile을 제거(age off)하는 시간 간격이에요. |
| Cache Entry Identifier | FlowFile 속성이거나 Attribute Expression Language 문의 결과로, FlowFile에 대해 평가되어 중복 여부를 식별하는 값을 결정하는 데 사용해요. 이 값이 캐시돼요. |
| Cache The Entry Identifier | true이면 프로세서가 중복을 확인하고 Entry Identifier를 캐시해요. false이면 프로세서는 중복만 확인하고 Entry Identifier를 캐시하지 않아, 다른 프로세서가 분산 캐시에 식별자를 추가해야 해요. |
| Distributed Cache Service | 중복 여부를 판단하는 고유 식별자를 캐시하는 데 사용하는 Controller Service예요. |
| FlowFile Description | FlowFile이 캐시에 추가되면 이 값도 함께 저장되는데, 중복이 발견되면 원본 FlowFile의 이 설명이 중복 항목의 "original.flowfile.description" 속성에 추가돼요. |
관계(Relationships)
| 이름(Name) | 설명(Description) |
|---|---|
| duplicate | FlowFile이 중복으로 감지되면 이 관계로 라우팅돼요. |
| failure | 캐시와 통신할 수 없으면 FlowFile에 패널티가 주어지고 이 관계로 라우팅돼요. |
| non-duplicate | FlowFile의 Cache Entry Identifier가 캐시에서 발견되지 않으면 이 관계로 라우팅돼요. |
속성 기록(Writes attributes)
| 이름(Name) | 설명(Description) |
|---|---|
| original.flowfile.description | duplicate 관계로 라우팅된 모든 FlowFile에는 original.flowfile.description이라는 속성이 추가돼요. 이 속성의 값은 원본 데이터 사본의 속성과 FlowFile Description 속성에 의해 결정돼요. |