cluster_table_function_* 세션 설정
cluster_table_function_* 세션 설정
이 설정들은 CLUSTER TABLE FUNCTION(클러스터 테이블 함수)이 작업을 분산 처리할 때의 배치 크기와 분할 세분화(split granularity)를 제어해요. ClickHouse 소스 코드에서 자동으로 생성된 세션 설정 문서예요.
출처: 문서
본문
이 설정들은 system.settings에서 사용할 수 있으며 소스 코드에서 자동으로 생성돼요.
cluster_table_function_buckets_batch_size
bucket 분할 세분화를 사용하는 클러스터 테이블 함수에서 작업의 분산 처리에 사용되는 배치의 대략적인 크기(바이트)를 정의해요. 시스템은 이 정도량에 도달할 때까지 데이터를 누적해요. 실제 크기는 데이터 경계에 맞추기 위해 약간 더 클 수 있어요.
cluster_table_function_split_granularity
CLUSTER TABLE FUNCTION을 실행할 때 데이터를 작업(task)으로 어떻게 나눌지 제어해요.
이 설정은 클러스터 전반의 작업 분배 세분화를 정의해요:
file— 각 작업이 전체 파일을 처리해요.bucket— 파일 내부의 데이터 블록별로 작업이 생성돼요(예: Parquet 행 그룹).
bucket 같은 더 세밀한 세분화를 선택하면 적은 수의 큰 파일을 다룰 때 병렬성을 높일 수 있어요. 예를 들어 Parquet 파일에 여러 행 그룹이 있으면 bucket 세분화를 활성화하면 각 그룹을 서로 다른 워커가 독립적으로 처리할 수 있어요.