nanoGPT — 가장 단순하고 빠른 GPT 학습 저장소

nanoGPT

GPT를 직접 학습시키고 싶은데 수백 줄의 프레임워크 코드는 부담스러워요. 그래서 nanoGPT는 "이빨(성능)을 교육보다 우선"해 만든, 가장 단순하고 빠른 중간 규모 GPT 학습 저장소예요. train.py는 약 300줄의 학습 루프이고 model.py는 약 300줄의 GPT 모델 정의예요. 이 코드만으로 단일 8XA100 40GB 노드에서 GPT-2(124M)를 OpenWebText로 약 4일 학습해 재현할 수 있어요. 코드가 너무 단순해서 새 모델을 처음부터 학습하거나 사전학습 체크포인트를 파인튜닝하기도 쉬워요.

이 카테고리의 문서

  • 소개: nanoGPT가 왜 만들어졌고 무엇을 재현하는지
  • 모델 구조: model.py의 GPT 정의 읽기
  • 실전 학습: GPT-2(124M) 재현 설정

출처: https://github.com/karpathy/nanoGPT