Apache Hadoop
Apache Hadoop
Apache Hadoop은 데이터를 여러 대의 컴퓨터에 나눠 저장하고, 그 컴퓨터들을 모아 한 대처럼 계산하는 프레임워크예요. 저장은 HDFS(Hadoop Distributed File System)가, 계산은 MapReduce가 담당해서(지금은 YARN 위에서 다양한 엔진이 도는 형태로 진화했어요) 아주 큰 데이터를 규모 있게 다룰 수 있게 해줘요.
핵심 개념
- HDFS: 블록 단위로 파일을 분산 저장하는 파일 시스템. 네임노드가 메타데이터, 데이터노드가 실제 데이터를 맡아요.
- MapReduce: 키-값 쌍을 매핑(map)하고 리듀스(reduce)하는 배치 처리 모델이에요.
- YARN: 클러스터의 CPU·메모리를 관리하고 애플리케이션을 스케줄링하는 자원 관리 계층이에요.
이 카테고리의 문서
- 저장: HDFS 아키텍처, 네임노드, 데이터노드, 분산 파일 시스템
- 계산: MapReduce, YARN