hudiCluster 테이블 함수

hudiCluster 테이블 함수

hudi 테이블 함수의 확장이에요. 지정된 클러스터의 여러 노드에서 Amazon S3의 Apache Hudi 테이블 파일들을 병렬로 처리할 수 있게 해줘요.

출처: 문서

본문

이 함수는 hudi 테이블 함수의 확장이에요.

지정된 클러스터의 여러 노드에서 Amazon S3의 Apache Hudi 테이블 파일을 병렬로 처리할 수 있어요. 이니시에이터(initiator)는 클러스터의 모든 노드에 연결을 만들고 각 파일을 동적으로 분배해요. 워커 노드는 이니시에이터에게 처리할 다음 작업을 물어보고 처리해요. 이 과정은 모든 작업이 끝날 때까지 반복돼요.

문법 (Syntax)

hudiCluster(cluster_name, url [,aws_access_key_id, aws_secret_access_key] [,format] [,structure] [,compression] [,extra_credentials])

인자 (Arguments)

인자 설명
cluster_name 원격·로컬 서버의 주소 집합과 연결 파라미터를 만드는 데 사용하는 클러스터 이름이에요.
url S3에 존재하는 Hudi 테이블의 경로를 포함한 버킷 URL이에요.
aws_access_key_id, aws_secret_access_key AWS 계정 사용자의 장기 자격 증명이에요. 요청을 인증하는 데 사용할 수 있어요. 이 파라미터는 선택 사항이에요. 자격 증명을 지정하지 않으면 ClickHouse 설정에서 가져와요. 자세한 내용은 데이터 저장을 위한 S3 사용을 참고하세요.
format 파일의 포맷이에요.
structure 테이블의 구조예요. 'column1_name column1_type, column2_name column2_type, ...' 형태로 지정해요.
compression 선택 사항이에요. 지원 값: none, gzip/gz, deflate, brotli/br, xz/LZMA, zstd/zst, lz4, bz2, snappy. 기본적으로 압축은 파일 확장자로 자동 감지돼요. snappy의 경우 와이어 포맷은 snappy_mode 설정(기본은 basic`)으로 선택돼요.
extra_credentials 선택 사항이에요. ClickHouse Cloud에서 역할 기반 접근을 위한 role_arn을 전달하는 데 사용해요. 구성 단계는 Secure S3를 참고하세요.

반환값 (Returned value)

S3의 지정된 Hudi 테이블에서 클러스터의 데이터를 읽을 수 있는, 지정된 구조를 가진 테이블이에요.

가상 컬럼 (Virtual Columns)

  • _path — 파일의 경로예요. 타입: LowCardinality(String).
  • _file — 파일의 이름이에요. 타입: LowCardinality(String).
  • _size — 바이트 단위의 파일 크기예요. 타입: Nullable(UInt64). 파일 크기를 알 수 없으면 값은 NULL이에요.
  • _time

더 알아보기 (Learn more)