Hive on Spark 시작 가이드
Hive on Spark 시작 가이드 (Hive on Spark Getting Started)
Hive는 실행 엔진으로 MapReduce 외에도 Apache Spark를 사용할 수 있어요. 성능이 중요한 워크로드에서 유용하며, 이 문서는 Hive on Spark를 설정하고 실행하는 방법을 안내합니다.
출처: 문서
본문
Hive on Spark를 시작하는 방법을 설명합니다.
개요 (Overview)
Hive on Spark는 Hive의 쿼리 실행 엔진으로 Spark를 사용하는 기능입니다. 많은 쿼리에서 MapReduce보다 빠른 성능을 보여주며, 특히 반복·인메모리 연산에 강점이 있습니다.
실행 엔진 설정
Hive 쿼리의 실행 엔진을 Spark로 지정합니다.
SET hive.execution.engine=spark;
또는 hive-site.xml의 hive.execution.engine 속성을 spark로 설정해 기본 엔진으로 지정할 수 있습니다.
요구 사항
- 호환되는 Spark 버전이 설치되어 있어야 합니다.
- Spark 애플리케이션에 필요한 메모리·리소스 설정을 지정해야 합니다.
spark.master: Spark 실행 모드(로컬, YARN 등)spark.executor.memory: 실행자 메모리spark.executor.cores/spark.executor.instances: 실행자 수와 코어
실행 확인
SET 명령으로 현재 엔진을 확인하고, 간단한 쿼리를 실행해 동작을 검증합니다.
SET hive.execution.engine;
SELECT count(*) FROM t1;
좋은 성능을 위한 고려사항
- Spark 메모리 설정이 워크로드에 맞게 조정되어 있어야 합니다.
- 작은 작업보다는 Spark의 장점이 드러나는 중·대형 워크로드에서 효과가 큽니다.
참고: 구체적인 Spark 버전 호환성, 메모리 산정 기준, YARN 연동 설정은 원문 문서와 Hive 릴리스 노트를 참고하세요.
더 알아보기 (Learn more)
- Hive on Spark는 구성이 완료되면 기존 SQL은 그대로 두고 엔진을 바꾸는 것만으로 성능을 개선할 수 있는 경우가 많아요. MapReduce와의 성능 차이를 직접 측정해 보세요.