Data Designer
Data Designer
Data Designer는 NVIDIA NeMo의 프레임워크로, LLM을 사용해 고품질 합성 데이터셋을 생성해요. 통계적 샘플러, LLM, 또는 기존 시드 데이터셋을 사용해 다양한 데이터를 만들 수 있습니다.
출처: 문서
본문
Data Designer는 NVIDIA NeMo가 LLM을 사용해 고품질 합성 데이터셋을 생성하는 프레임워크입니다. 통계적 샘플러, LLM, 또는 기존 시드 데이터셋으로 다양한 데이터를 만들 수 있어요.
사전 요구사항 (Prerequisites)
pip install data-designer
Hub에서 데이터셋을 시드로 다운로드 (Download datasets from the Hub as seeds)
HuggingFaceSeedSource를 사용해 생성의 시드 데이터로 Hub에서 직접 데이터셋을 불러올 수 있어요.
import data_designer.config as dd
from data_designer.interface import DataDesigner
data_designer = DataDesigner()
config_builder = dd.DataDesignerConfigBuilder()
# Load seed data from HuggingFace
seed_source = dd.HuggingFaceSeedSource(
path="datasets/gretelai/symptom_to_diagnosis/data/train.parquet",
token="hf_...", # Optional, for private datasets
)
config_builder.with_seed_dataset(seed_source)
# Reference seed columns in prompts
config_builder.add_column(
dd.LLMTextColumnConfig(
name="physician_notes",
model_alias="openai-gpt-5",
prompt="Write notes for a patient with {{ diagnosis }}. Symptoms: {{ patient_summary }}",
)
)
preview = data_designer.preview(config_builder, num_records=5)
생성된 데이터셋을 Hub에 푸시 (Push generated datasets to the Hub)
내장 push_to_hub 메서드로 생성된 데이터셋을 Hub에 업로드할 수 있어요.
# Generate dataset
results = data_designer.create(config_builder, num_records=1000, dataset_name="my-dataset")
# Push to Hub
url = results.push_to_hub(
repo_id="username/my-synthetic-dataset",
description="Synthetic dataset generated with Data Designer.",
tags=["medical", "notes"],
private=False,
)
리소스 (Resources)
더 알아보기 (Learn more)
HuggingFaceSeedSource로 Hub의 데이터셋을 시드로 로드하고, preview로 샘플을 확인한 뒤 create로 합성 데이터를 생성해요. 생성 결과는 results.push_to_hub(repo_id=...)로 Hub에 푸시할 수 있습니다. 자세한 내용은 Data Designer 문서와 가이드를 참고하세요.