DuckDB 가이드 개요
DuckDB 가이드 개요 (Guides - overview-guides-overview)
DuckDB 공식 문서의 가이드(Guides) 섹션은 단일 목표에 집중한 간결한 how-to 가이드들이에요. API 레퍼런스나 예제가 필요하다면 문서의 다른 부분을 보면 되고, 여기는 "이걸 어떻게 하지?"에 대한 실용적인 답을 주는 곳이죠.
가이드 소개 (Introduction)
가이드 섹션은 하나의 목표를 달성하는 데 집중한 간결한 방법 가이드(how-to guides) 로 구성돼 있어요. API 레퍼런스와 예제는 문서의 나머지 부분을 참고하면 돼요.
참고로 공식 가이드에는 다루지 않지만 DuckDB를 쓰는 도구가 많아요. 그런 도구 목록을 찾고 싶다면 Awesome DuckDB 저장소를 확인해 보세요.
Tip 짧은 입문 튜토리얼이 필요하면 "Analyzing Railway Traffic in the Netherlands" 튜토리얼을 확인해 보세요.
데이터 가져오기와 내보내기 (Data Import and Export)
CSV 파일 (CSV Files)
Parquet 파일 (Parquet Files)
HTTP(S), S3, GCP
- S3 / AWS에 인증하기
- HTTP(S)에서 Parquet 파일 직접 로드하기
- S3에서 Parquet 파일 직접 로드하기
- Parquet 파일을 S3로 내보내기
- S3 Express One에서 Parquet 파일 로드하기
- GCS에서 Parquet 파일 직접 로드하기
- Cloudflare R2에서 Parquet 파일 직접 로드하기
- S3에서 Iceberg 테이블 직접 로드하기
- Amazon S3 Tables에 연결하기
- Amazon SageMaker Lakehouse (AWS Glue)에 연결하기
JSON 파일 (JSON Files)
Spatial 확장으로 Excel 파일 다루기 (Excel Files with the Spatial Extension)
다른 데이터베이스 시스템 쿼리하기 (Querying Other Database Systems)
- MySQL 데이터베이스 직접 쿼리하기
- PostgreSQL 데이터베이스 직접 쿼리하기
- SQLite 데이터베이스 직접 쿼리하기
- IAM 인증으로 Amazon RDS / Aurora에 연결하기
파일 직접 읽기 (Directly Reading Files)
성능 (Performance)
- 내 워크로드가 느려요 (문제 해결 가이드)
- 최적 성능을 위한 스키마 설계
- DuckDB에 이상적인 하드웨어 환경
- Parquet 파일과 (압축된) CSV 파일이 성능에 미치는 영향
- 워크로드 튜닝하기
- 벤치마크
메타 쿼리 (Meta Queries)
ODBC
Python 클라이언트 (Python Client)
- Python 클라이언트 설치
- SQL 쿼리 실행
- Jupyter Notebook에서 쉽게 쿼리하기
- marimo Notebook에서 쉽게 쿼리하기
- DuckDB와 함께 여러 Python 스레드 사용
- DuckDB와 함께 fsspec 파일시스템 사용
Pandas
Apache Arrow
Relational API
Python 라이브러리 통합 (Python Library Integrations)
- SQL 있든 없든 Ibis로 DuckDB 쿼리하기
- Apache Arrow로 Polars DataFrame과 함께 DuckDB 사용
- Apache Arrow로 DuckDB 쿼리 결과를 PyTorch로 스트리밍