문서 QA 데이터 생성 실전 쿡북
문서 QA 데이터 생성 실전 쿡북
Hugging Face 쿡북은 문서에서 Q/A 쌍을 합성 생성해 전용 챗봇을 파인튜닝 하는 완결된 예제를 제공해요. 좁은 도메인에 대량의 수동 데이터 없이 적응시키는 전형적 워크플로예요.
파이프라인
- 데이터 확보: 대상 공식 문서(예: LangChain 문서)의 텍스트를 수집.
- 합성 데이터 생성: Meta의
synthetic-data-kit(Unsloth 래퍼)로 문서에서 Q/A 쌍을 자동 생성. - 효율적 파인튜닝: TRL의 SFTTrainer로 Llama-3.2-3B를 합성 데이터 위에서 학습(Unsloth로 가속).
- 평가: 파인튜닝된 모델에 구체적 질문을 던져 정확도를 확인.
생성 예시
from unsloth.dataprep import SyntheticDataKit
generator = SyntheticDataKit.from_pretrained(
model_name="unsloth/Llama-3.2-3B-Instruct",
max_seq_length=2048,
)
generator.prepare_qa_generation(
output_folder="data",
temperature=0.7,
top_p=0.95,
overlap=64,
max_generation_tokens=512,
)
핵심 포인트
문서 단위로 청크를 잘라(overlap) LLM이 질문을 만들게 하면, 고유 도메인 지식을 담은 훈련 쌍이 만들어져요. 이후 파인튜닝하면 문서 내용을 정확히 아는 전용 챗봇이 탄생해요. 도메인 적응형 합성 파이프라인의 좋은 출발점이에요.