Vector Database 개요 — 개념과 필요성
Vector Database 개요
벡터 데이터베이스는 벡터 임베딩을 인덱싱·저장하고 유사도 검색을 빠르게 수행하기 위한 데이터베이스예요. AI 혁명으로 비정형 데이터가 폭증하면서, 이런 데이터를 실시간으로 다루기 위해 설계됐어요.
핵심 기능
- 임베딩 저장: 문서·이미지·오디오를 벡터로 변환해 보관
- 유사도 검색: 질의 벡터와 가장 가까운 벡터를 실시간 정렬
- CRUD: 벡터의 생성·조회·수정·삭제
- 메타데이터 필터링: 벡터에 붙은 메타데이터로 범위 제한 검색
- 수평 확장·서버리스: 데이터가 늘어도 인프라를 유연하게 확장
왜 일반 DB가 아닌가
일반 DB는 정확 매칭·정렬에 강하지만, 고차원 벡터의 거리 검색은 데이터가 많아지면 매우 느려져요. 벡터 DB는 ANN(근사 최근접 이웃) 인덱스로 검색 후보를 줄여서 대규모에서도 빠른 응답을 유지해요.
용도
- RAG: 문서 임베딩 저장 + 관련 청크 검색
- 시맨틱 검색: 의미 기반 검색
- 추천 시스템: 벡터 유사도 기반 추천
- 이상 탐지·중복 제거: 벡터 거리로 판별