Instruction Tuning — 지시대로 답하는 모델 만들기

Instruction Tuning

기본 언어 모델은 다음 토큰을 잘 맞추지만 '지시를 수행'하진 못해요. Instruction Tuning(지시 파인튜닝) 은 (지시, 응답) 쌍 데이터로 모델을 지도 학습해, 사용자 지시를 잘 따르는 모델로 만드는 post-training 기법이에요. TRL의 SFTTrainer가 대표 도구예요.

이 카테고리의 문서

  • 개요: TRL 개요 — post-training 풀스택 라이브러리
  • 핵심 기능: SFTTrainer — 지시 데이터로 모델 훈련하기
  • 실전·API: TRL 퀵스타트 — SFT·GRPO·DPO 한눈에

출처: https://huggingface.co/docs/trl/main/en/index