Deeplake 빠른 시작 — 2분 만에 질의 가능한 테이블
Deeplake 빠른 시작
Deeplake 문서는 '2분 만에 동작하는 질의'를 약속해요. 흐름은 SDK 사용자 준비 → 테이블 생성·삽입 → 질의 → 데이터셋 접근 → 버전 관리 → 트레이닝 스트리밍 순서예요.
설정
pip install deeplake
API 토큰은 deeplake.ai의 workspace 설정에서 받고, 환경변수로 관리하는 걸 권장해요.
export DEEPLAKE_API_KEY="your-token-here"
export DEEPLAKE_WORKSPACE="your-workspace"
export DEEPLAKE_ORG_ID="your-org-id"
테이블 생성과 질의
ingest()로 구조화 데이터를 넣으면 스키마를 자동 추론해요. INSERT 뒤 몇 초 안에는 SELECT에 안 보일 수 있다는 점(eventual consistency)만 기억해요.
import os
from deeplake import Client
client = Client(
token=os.environ.get("DEEPLAKE_API_KEY"),
workspace_id=os.environ.get("DEEPLAKE_WORKSPACE"),
)
client.ingest("my_first_table", {
"title": ["Getting started", "Vector search", "Hybrid search"],
"content": ["Deeplake unifies tables, files, and search.",
"Use the <#> operator for similarity queries.",
"Combine BM25 and vector for best results."],
})
질의는 플루언트 API로도, raw SQL로도 해요.
results = (client.table("my_first_table").select("title", "content").limit(10))()
# 또는
rows = client.query("SELECT * FROM my_first_table")