언어 매뉴얼 - 통계와 데이터 마이닝
언어 매뉴얼 - 통계와 데이터 마이닝 (Language Manual - Statistics and Data Mining)
Hive의 통계(Statistics)와 데이터 마이닝 관련 기능을 설명하는 문서예요. 테이블·파티션·컬럼의 통계를 수집해 조회 성능과 쿼리 최적화에 활용할 수 있고, 마이닝 관련 함수도 제공합니다.
출처: 문서
본문
Hive의 통계 및 데이터 마이닝 기능을 설명합니다.
통계 수집 (Statistics)
Hive는 테이블과 파티션에 대한 통계를 수집할 수 있습니다. 통계 정보는 옵티마이저가 실행 계획(조인 순서, MapJoin 여부 등)을 결정하는 데 사용되어 성능에 긍정적 영향을 줍니다.
- 테이블 통계: 행 수, 파일 크기, 데이터 크기 등
- 파티션 통계: 파티션별 통계
- 컬럼 통계:
ANALYZE TABLE ... COMPUTE STATISTICS FOR COLUMNS로 각 컬럼의 기초 통계를 수집
예시:
ANALYZE TABLE employees COMPUTE STATISTICS;
ANALYZE TABLE employees PARTITION (dept='10') COMPUTE STATISTICS;
ANALYZE TABLE employees COMPUTE STATISTICS FOR COLUMNS;
수집된 통계는 SHOW TABLE STATS / SHOW COLUMN STATS 같은 명령으로 확인할 수 있습니다.
데이터 마이닝 관련
Hive는 데이터 마이닝 목적으로 활용할 수 있는 여러 내장 함수를 제공합니다. (예: 상관관계 분석에 쓰이는 함수, 군집화·분류와 관련된 함수 등)
참고: 제공되는 마이닝 함수의 정확한 목록과 시그니처, 통계 관련 설정 속성은 원문 문서를 참고하세요.
더 알아보기 (Learn more)
- 통계를 수집하면 옵티마이저가 더 나은 실행 계획을 세울 수 있어요. 특히 대용량 테이블의 조인 쿼리 성능이 크게 달라질 수 있습니다.