Data Designer

Data Designer

Data Designer는 NVIDIA NeMo의 프레임워크로, LLM을 사용해 고품질 합성 데이터셋을 생성해요. 통계적 샘플러, LLM, 또는 기존 시드 데이터셋을 사용해 다양한 데이터를 만들 수 있습니다.

출처: 문서

본문

Data Designer는 NVIDIA NeMo가 LLM을 사용해 고품질 합성 데이터셋을 생성하는 프레임워크입니다. 통계적 샘플러, LLM, 또는 기존 시드 데이터셋으로 다양한 데이터를 만들 수 있어요.

사전 요구사항 (Prerequisites)

pip install data-designer

Hub에서 데이터셋을 시드로 다운로드 (Download datasets from the Hub as seeds)

HuggingFaceSeedSource를 사용해 생성의 시드 데이터로 Hub에서 직접 데이터셋을 불러올 수 있어요.

import data_designer.config as dd
from data_designer.interface import DataDesigner

data_designer = DataDesigner()
config_builder = dd.DataDesignerConfigBuilder()

# Load seed data from HuggingFace
seed_source = dd.HuggingFaceSeedSource(
    path="datasets/gretelai/symptom_to_diagnosis/data/train.parquet",
    token="hf_...",  # Optional, for private datasets
)
config_builder.with_seed_dataset(seed_source)

# Reference seed columns in prompts
config_builder.add_column(
    dd.LLMTextColumnConfig(
        name="physician_notes",
        model_alias="openai-gpt-5",
        prompt="Write notes for a patient with {{ diagnosis }}. Symptoms: {{ patient_summary }}",
    )
)

preview = data_designer.preview(config_builder, num_records=5)

생성된 데이터셋을 Hub에 푸시 (Push generated datasets to the Hub)

내장 push_to_hub 메서드로 생성된 데이터셋을 Hub에 업로드할 수 있어요.

# Generate dataset
results = data_designer.create(config_builder, num_records=1000, dataset_name="my-dataset")

# Push to Hub
url = results.push_to_hub(
    repo_id="username/my-synthetic-dataset",
    description="Synthetic dataset generated with Data Designer.",
    tags=["medical", "notes"],
    private=False,
)

리소스 (Resources)

더 알아보기 (Learn more)

HuggingFaceSeedSource로 Hub의 데이터셋을 시드로 로드하고, preview로 샘플을 확인한 뒤 create로 합성 데이터를 생성해요. 생성 결과는 results.push_to_hub(repo_id=...)로 Hub에 푸시할 수 있습니다. 자세한 내용은 Data Designer 문서와 가이드를 참고하세요.