Synthetic Data — LLM으로 훈련 데이터를 직접 만들기
Synthetic Data
라벨링 비용이 커지고 데이터 수집이 어려워지면서, LLM이 직접 라벨을 만들어내는 합성 데이터(Synthetic Data) 가 주목받아요. 강력한 개방형 모델로 데이터를 만들고, 작은 전용 모델을 그 위에서 파인튜닝하면 비용·시간·탄소를 크게 아낄 수 있어요.
이 카테고리의 문서
- 개요: 왜 합성 데이터인가 — 비용·시간·탄소 절감
- 핵심 기능: NeMo DataDesigner — LLM 기반 합성 데이터 생성
- 실전·API: 문서 QA 데이터 생성 실전 쿡북