언어 매뉴얼 - 통계와 데이터 마이닝

언어 매뉴얼 - 통계와 데이터 마이닝 (Language Manual - Statistics and Data Mining)

Hive의 통계(Statistics)와 데이터 마이닝 관련 기능을 설명하는 문서예요. 테이블·파티션·컬럼의 통계를 수집해 조회 성능과 쿼리 최적화에 활용할 수 있고, 마이닝 관련 함수도 제공합니다.

출처: 문서

본문

Hive의 통계 및 데이터 마이닝 기능을 설명합니다.

통계 수집 (Statistics)

Hive는 테이블과 파티션에 대한 통계를 수집할 수 있습니다. 통계 정보는 옵티마이저가 실행 계획(조인 순서, MapJoin 여부 등)을 결정하는 데 사용되어 성능에 긍정적 영향을 줍니다.

  • 테이블 통계: 행 수, 파일 크기, 데이터 크기 등
  • 파티션 통계: 파티션별 통계
  • 컬럼 통계: ANALYZE TABLE ... COMPUTE STATISTICS FOR COLUMNS 로 각 컬럼의 기초 통계를 수집

예시:

ANALYZE TABLE employees COMPUTE STATISTICS;

ANALYZE TABLE employees PARTITION (dept='10') COMPUTE STATISTICS;

ANALYZE TABLE employees COMPUTE STATISTICS FOR COLUMNS;

수집된 통계는 SHOW TABLE STATS / SHOW COLUMN STATS 같은 명령으로 확인할 수 있습니다.

데이터 마이닝 관련

Hive는 데이터 마이닝 목적으로 활용할 수 있는 여러 내장 함수를 제공합니다. (예: 상관관계 분석에 쓰이는 함수, 군집화·분류와 관련된 함수 등)

참고: 제공되는 마이닝 함수의 정확한 목록과 시그니처, 통계 관련 설정 속성은 원문 문서를 참고하세요.

더 알아보기 (Learn more)

  • 통계를 수집하면 옵티마이저가 더 나은 실행 계획을 세울 수 있어요. 특히 대용량 테이블의 조인 쿼리 성능이 크게 달라질 수 있습니다.