데이터셋
데이터셋 (Datasets)
이 페이지는 Cohere의 데이터셋과 이를 사용하는 방법을 설명해요. Cohere Python SDK로 데이터셋을 만들고, 업로드하고, 검증하는 과정과 다양한 예시를 살펴볼게요.
출처: 문서
본문
이 페이지는 Cohere Python SDK로 데이터셋을 사용하는 방법을 설명해요. 시작하는 방법부터 시작해, 데이터셋을 만들고, 업로드하고, 검증하는 방법을 자세히 다룬 뒤, 몇 가지 예시와 더 고급 사용 사례 및 문제 해결 방법으로 마무리해요.
시작하기 (Getting Started)
먼저 Cohere Python SDK가 설치되어 있어야 해요. 이미 설치되어 있다면 이 단계를 건너뛸 수 있어요.
1단계: API 키 받기
Datasets API를 사용하려면 계정의 API 키가 필요해요. 자세한 내용은 API 키와 토큰 페이지를 확인하세요.
2단계: SDK 설치하기
pip install cohere로 SDK를 설치해요.
3단계: 클라이언트 만들기
SDK를 사용해 클라이언트를 만들어요:
PYTHON
from cohere import Client
co = Client(api_key=" YOUR API KEY")
4단계: 데이터셋 업로드하기
데이터셋을 Cohere 서비스에 업로드해요. 데이터셋을 업로드하면 그 ID를 검색할 수 있고, 이후 호출에서 이를 참조하는 데 사용할 수 있어요.
데이터셋 업로드하기 (Upload Your Dataset)
데이터셋을 만드는 가장 흔한 방법은 Upload 섹션에서 자신의 파일을 업로드하는 거예요:
PYTHON
# Create your first dataset
import cohere
co = cohere.Client(api_key="YOUR API KEY")
resp = co.datasets.create(name="your-dataset", data=fp)
print(resp.id)
# note: when done, delete your dataset
co.datasets.delete(dataset_id=resp.id)
데이터 검증하기 (Validate Your Data)
Cohere는 업로드 시 데이터가 기대에 부합하는지 검증을 수행해요. 잘못된 파일이나 데이터를 감지하면 삭제하거나 격리할 수 있어요.
업로드 엔드포인트 (Upload Endpoints)
업로드는 엔드포인트마다 동일하지 않아요. 업로드의 경우 사용자가 사용할 수 있는 두 가지 유형의 엔드포인트가 있어요:
-
Company가 필요한 업로드 엔드포인트:
소유자 조직 ID, 파일 형식과 크기가 검증되는 엔드포인트
-
대량 업로드 엔드포인트 (bulk upload endpoints)
데이터셋 목록 조회하기 (List Datasets)
다음 코드로 만든 모든 데이터셋을 나열할 수 있어요.
PYTHON
# Get a list of datasets
import cohere
co = cohere.Client(api_key="YOUR API KEY")
# List datasets
resp = co.datasets.list();
print(resp)
# List only datasets created by you
resp = co.datasets.list(created_by_me=True)
print(resp)
데이터셋 이름과 버전 찾는 방법 (How to find Dataset Name and Version)
Datasets API를 호출해 데이터셋 이름과 버전을 검색할 수 있어요. 예:
PYTHON
# Get dataset name and version
import cohere
co = cohere.Client(api_key="YOUR API KEY")
resp = co.datasets.list();
for d in resp.datasets:
print(d)
예시: 파인튜닝 데이터셋
데이터셋을 파인튜닝 작업에 적용하는 예시는 다음과 같아요:
PYTHON
from cohere import Client
co = Client(api_key="YOUR API KEY")
co.finetune.create(name="your_finetune", dataset_id="3d3f8eba0cb280b6e339en3n9fym")
예시: 분류 데이터셋
분류에 데이터셋을 사용하는 예시는 다음과 같아요:
PYTHON
from cohere import Client
co = Client(api_key="YOUR API KEY")
resp = co.classify(
inputs=["I love this"],
model="embed-v4.0",
examples=[
"Do you use TensorFlow or PyTorch?"
],
)
print(resp)
문제 해결 (Troubleshooting)
Datasets API는 데이터셋 또는 그 태그에 검증 오류가 있으면 DatasetValidationError를 반환해요.
자주 묻는 질문 (Frequently Asked Questions)
자세한 내용은 FAQs 페이지를 확인하세요.