데이터 관리
데이터 관리 (data-management)
Qdrant로 데이터를 다루는 방법을 정리한 페이지예요. 크게 두 가지 흐름이 있는데요, 기존 벡터 데이터베이스에서 Qdrant로 옮겨오는 마이그레이션과 **다른 도구들과 연동해서 데이터를 주고받는 통합(Integration)**이에요. 각각 어떤 하위 문서들이 있는지 하나씩 살펴볼게요.
출처: Qdrant 공식문서
Qdrant로 마이그레이션
다른 벡터 데이터베이스를 쓰고 있다가 Qdrant로 옮기고 싶은 경우가 많죠. Qdrant는 각 데이터베이스별로 전용 마이그레이션 가이드를 제공해요. 마이그레이션 도구 문서를 기준으로, 다음과 같은 소스에서 옮기는 방법을 다룹니다.
마이그레이션 도구 (Migrate to Qdrant)
- Pinecone에서
- Weaviate에서
- Milvus에서
- Elasticsearch에서
- OpenSearch에서
- pgvector에서
- S3 Vectors에서
- Chroma에서
- Redis에서
- MongoDB에서
- FAISS에서
- Apache Solr에서
- Qdrant에서
마이그레이션 가이드 (Migration Guidance)
마이그레이션을 실제로 진행하기 전에 짚고 넘어가야 할 것들이 있어요. 마이그레이션 가이드 문서 안에 다음 내용이 들어 있죠.
- 사전 마이그레이션 기준 (Pre-Migration Baseline)
- 데이터 무결성 (Data Integrity)
- 검색 품질 (Search Quality)
- 불일치 진단 (Diagnosing Discrepancies)
데이터 동기화 (Data Synchronization)
마이그레이션 후에도 계속 데이터를 맞춰야 할 때가 있어요. 데이터 동기화 문서에서는 주로 관계형 데이터베이스와의 동기화를 다룹니다.
데이터 관리 통합 (Data Management Integrations)
데이터 흐름을 자동화하고 싶다면, 기존 데이터 파이프라인 도구와 Qdrant를 연결하는 방법도 있어요. 아래 표는 각 통합 도구가 무엇을 위한 것인지 한눈에 보여줘요.
| 통합 (Integration) | 설명 (Description) |
|---|---|
| Airflow | 배치 지향 워크플로우를 개발·스케줄링·모니터링하기 위한 플랫폼 |
| Airbyte | 데이터 소스 간 데이터 이동을 자동화하는 오픈소스 통합 플랫폼 |
| Apache Spark | 대규모 데이터 처리를 위한 클러스터 컴퓨팅 엔진 |
| Chonkie | 텍스트를 청크(chunk)로 나누는 데 도움을 주는 라이브러리 |
| CocoIndex | 데이터 인덱싱 파이프라인을 선언적으로 정의하는 도구 |
| Confluent Kafka | 실시간 스트리밍 데이터를 Qdrant로 전달하는 Kafka 연동 |
| DLT | 다양한 소스에서 데이터를 로드하는 오픈소스 데이터 로딩 라이브러리 |
| InfinyOn Fluvio | 스트리밍 데이터를 처리하는 Fluvio 연동 |
| POMA | 데이터 처리 및 관리를 위한 통합 도구 |
| Redpanda Connect | 이벤트 스트리밍 연결을 위한 Redpanda 연동 |
| Unstructured | 다양한 소스에서 데이터를 수집·전처리하는 컴포넌트를 제공하는 Python 라이브러리 |
이 외에도 Embeddings 등 임베딩 관련 문서로 이어지니, 벡터 표현 자체에 관심이 있다면 그쪽도 함께 보면 좋아요.
더 알아보기 (Learn more)
- 마이그레이션 도구 — 다양한 벡터 DB에서 Qdrant로 옮기는 전용 가이드
- 데이터 동기화 — Postgres 같은 소스와 Qdrant를 계속 맞추는 방법
- Qdrant 공식 문서 홈