Amazon Redshift 소개
Amazon Redshift 소개
Amazon Redshift가 어떤 서비스인지부터 정리해 볼게요. 클라우드에서 완전 관리형으로 제공되는 페타바이트 규모의 데이터 웨어하우스예요. 데이터셋 크기에 관계없이 데이터를 로드하고 곧바로 SQL로 분석할 수 있고, MySQL 같은 친숙한 SQL 기능을 그대로 쓸 수 있어요. 이 글을 보는 분이라면 이미 SQL 클라이언트 쓸 줄 알고 SQL 언어를 기본적으로 이해하고 있다고 보고 시작할게요.
출처: https://docs.aws.amazon.com/redshift/latest/dg/welcome.html
이 서비스가 주는 것
Amazon Redshift는 완전 관리형이라 페타바이트 규모의 데이터 웨어하우스를 직접 프로비저닝하거나 관리할 필요가 없어요. 특히 Amazon Redshift Serverless 옵션을 쓰면 프로비저닝된 웨어하우스처럼 일일이 설정하지 않아도 데이터에 접근하고 분석할 수 있어요. 리소스는 자동으로 준비되고 웨어하우스 용량은 지능적으로 스케일되어, 요구량이 크고 예측하기 어려운 워크로드에서도 빠른 성능을 내줘요.
핵심은 관리 부담을 없애는 거예요. 데이터셋이 아무리 커도 곧바로 데이터를 로드하고 쿼리 에디터 v2나 기존 BI 도구에서 바로 분석을 시작할 수 있어요. 웨어하우스가 유휴 상태일 때는 비용이 발생하지 않아서 쓴 만큼만 내는 구조예요. 좋은 가격 대비 성능과 익숙한 SQL 기능을, 관리할 게 거의 없는 환경에서 쓸 수 있다고 보면 돼요.
시작하기 전에 갖추면 좋은 것
첫 걸음으로는 Redshift Serverless 데이터 웨어하우스를 만드는 게 자연스러워요. 그 다음 쿼리 에디터 v2로 샘플 데이터를 로드해 보거나, S3에서 데이터를 로드하는 연습을 해 보면 흐름이 잡혀요. 웨어하우스를 다루기 위해서는 SQL 클라이언트 사용법과 SQL 언어의 기본 이해가 필요하니, 이 두 가지를 먼저 갖춰 두면 좋아요.