압축 저장
압축 저장 (Compressed Storage)
Hive에서는 저장 공간을 절약하고 I/O 성능을 높이기 위해 파일에 압축(Compression)을 적용할 수 있어요. 어떤 압축 코덱을 쓰느냐에 따라 압축률과 처리 속도가 달라집니다.
출처: 문서
본문
이 문서는 Hive의 압축 저장(Compressed Storage) 기능을 다룹니다.
압축의 이점
파일 저장 시 압축 코덱을 지정하면 디스크 공간을 절약할 수 있고, 읽기/쓰기 시 이동하는 데이터 양이 줄어들어 전체 성능이 개선될 수 있습니다. 다만 압축과 해제에 드는 CPU 비용이 추가됩니다.
압축 코덱
Hive는 표준 Hadoop 압축 코덱을 사용할 수 있습니다. 대표적인 코덱으로는 gzip, bzip2, snappy, lzo, zstd 등이 있으며, 코덱마다 압축률과 속도 특성이 다릅니다. 저장 포맷에 따라 지원되는 코덱이 달라질 수 있습니다.
압축 설정
Hive에서 압축을 설정하려면 관련 구성 속성을 지정하거나, 사용하는 저장 포맷에 맞는 압축 옵션을 선택합니다. 실제로는 hive.exec.compress.output 같은 속성을 이용해 쓰기 결과를 압축할지 정합니다.
참고: 원문 페이지에 있는 코덱별 상세 설정 표와 압축 옵션 예시는 업데이트에 따라 달라질 수 있어 원문 문서에서 함께 확인해 주세요.
더 알아보기 (Learn more)
- 압축 코덱 선택은 압축률과 속도 사이의 트레이드오프예요.
snappy는 속도가 빠르고,gzip/bzip2는 압축률이 높습니다. 워크로드에 맞춰 테스트해 보세요. - 관련 문서: File Formats, Parquet, ORC 등 저장 포맷 문서와 함께 보면 이해가 쉬워요.