데이터셋

데이터셋 (Datasets)

이 페이지는 Cohere의 데이터셋과 이를 사용하는 방법을 설명해요. Cohere Python SDK로 데이터셋을 만들고, 업로드하고, 검증하는 과정과 다양한 예시를 살펴볼게요.

출처: 문서

본문

이 페이지는 Cohere Python SDK로 데이터셋을 사용하는 방법을 설명해요. 시작하는 방법부터 시작해, 데이터셋을 만들고, 업로드하고, 검증하는 방법을 자세히 다룬 뒤, 몇 가지 예시와 더 고급 사용 사례 및 문제 해결 방법으로 마무리해요.

시작하기 (Getting Started)

먼저 Cohere Python SDK가 설치되어 있어야 해요. 이미 설치되어 있다면 이 단계를 건너뛸 수 있어요.

1단계: API 키 받기

Datasets API를 사용하려면 계정의 API 키가 필요해요. 자세한 내용은 API 키와 토큰 페이지를 확인하세요.

2단계: SDK 설치하기

pip install cohere로 SDK를 설치해요.

3단계: 클라이언트 만들기

SDK를 사용해 클라이언트를 만들어요:

PYTHON

from cohere import Client

co = Client(api_key=" YOUR API KEY")

4단계: 데이터셋 업로드하기

데이터셋을 Cohere 서비스에 업로드해요. 데이터셋을 업로드하면 그 ID를 검색할 수 있고, 이후 호출에서 이를 참조하는 데 사용할 수 있어요.

데이터셋 업로드하기 (Upload Your Dataset)

데이터셋을 만드는 가장 흔한 방법은 Upload 섹션에서 자신의 파일을 업로드하는 거예요:

PYTHON

# Create your first dataset
import cohere

co = cohere.Client(api_key="YOUR API KEY")

resp = co.datasets.create(name="your-dataset", data=fp)

print(resp.id)

# note: when done, delete your dataset
co.datasets.delete(dataset_id=resp.id)

데이터 검증하기 (Validate Your Data)

Cohere는 업로드 시 데이터가 기대에 부합하는지 검증을 수행해요. 잘못된 파일이나 데이터를 감지하면 삭제하거나 격리할 수 있어요.

업로드 엔드포인트 (Upload Endpoints)

업로드는 엔드포인트마다 동일하지 않아요. 업로드의 경우 사용자가 사용할 수 있는 두 가지 유형의 엔드포인트가 있어요:

  • Company가 필요한 업로드 엔드포인트:

    소유자 조직 ID, 파일 형식과 크기가 검증되는 엔드포인트

  • 대량 업로드 엔드포인트 (bulk upload endpoints)

데이터셋 목록 조회하기 (List Datasets)

다음 코드로 만든 모든 데이터셋을 나열할 수 있어요.

PYTHON

# Get a list of datasets
import cohere

co = cohere.Client(api_key="YOUR API KEY")

# List datasets
resp = co.datasets.list();

print(resp)

# List only datasets created by you
resp = co.datasets.list(created_by_me=True)

print(resp)

데이터셋 이름과 버전 찾는 방법 (How to find Dataset Name and Version)

Datasets API를 호출해 데이터셋 이름과 버전을 검색할 수 있어요. 예:

PYTHON

# Get dataset name and version
import cohere

co = cohere.Client(api_key="YOUR API KEY")

resp = co.datasets.list();

for d in resp.datasets:
    print(d)

예시: 파인튜닝 데이터셋

데이터셋을 파인튜닝 작업에 적용하는 예시는 다음과 같아요:

PYTHON

from cohere import Client

co = Client(api_key="YOUR API KEY")

co.finetune.create(name="your_finetune", dataset_id="3d3f8eba0cb280b6e339en3n9fym")

예시: 분류 데이터셋

분류에 데이터셋을 사용하는 예시는 다음과 같아요:

PYTHON

from cohere import Client

co = Client(api_key="YOUR API KEY")

resp = co.classify(
    inputs=["I love this"],
    model="embed-v4.0",
    examples=[
        "Do you use TensorFlow or PyTorch?"
    ],
)

print(resp)

문제 해결 (Troubleshooting)

Datasets API는 데이터셋 또는 그 태그에 검증 오류가 있으면 DatasetValidationError를 반환해요.

자주 묻는 질문 (Frequently Asked Questions)

자세한 내용은 FAQs 페이지를 확인하세요.

더 알아보기 (Learn more)