Distilabel 튜토리얼 — 논문 구현·엔드투엔드 예제

Distilabel 튜토리얼

Distilabel 문서의 튜토리얼은 크게 셋으로 나뉘어요. 엔드투엔드 튜토리얼은 전체 워크플로우를 단계별로, 논문 구현(Paper Implementations)은 합성 데이터 분야의 핵심 논문 재현을, 예제(Examples)는 설명 없이 작업별 코드만 보여줘요.

출처: https://distilabel.argilla.io/latest/sections/pipeline_samples/

엔드투엔드 튜토리얼

  • 선호 데이터셋 생성 — ORPO와 DPO용 합성 데이터 생성
  • 기존 선호 데이터셋 정제 — AI 피드백으로 기존 데이터셋을 정리하는 방법
  • 검색·랭킹 모델 — 커스텀 검색·랭킹 모델 파인튜닝용 합성 데이터
  • 텍스트 분류 데이터 생성 — 데이터 불균형·부족을 해소하는 합성 데이터

논문 구현

검증된 연구 논문을 재현한 샘플들이에요.

  • Deepseek Prover — 비공식 수학 문제에서 정리 증명용 수학 증명 생성
  • DEITA — 복잡도·품질의 프롬프트·응답 튜닝과 LLM-as-a-judge 기반 자동 데이터 선택
  • Instruction Backtranslation — 사람이 쓴 텍스트에 상응하는 지시를 자동 라벨링
  • Prometheus 2 — 직접 평가·쌍별 랭킹용 오픈소스 모델을 judge로 사용
  • UltraFeedback — 강력한 보상·비평 모델 훈련용 대규모 세밀한 선호 데이터셋
  • APIGen — 함수 호출 앱용 검증 가능한 고품질 데이터셋 생성
  • CLAIR — 대조적 선호 쌍을 만드는(Contrastive Learning from AI Revisions) 방법
  • Math Shepherd — 수학 풀이의 각 단계에 보상 점수를 주는 프로세스 보상 모델(PRM) 훈련 데이터

예제

  • Benchmarking with distilabel — Arena Hard 벤치마크 재현
  • Structured generation with outlines / instructor — pydantic.BaseModel과 함께 구조화 생성
  • Create questions and answers for an exam — 위키백과 페이지로 시험 문제 생성
  • Image generation with distilabel — 합성 이미지 생성

더 알아보기