Lamini 빠른 시작 — 추론과 Memory Tune
Lamini 빠른 시작
문서에서 '작은 LLM을 50%에서 90%+ 정확도로' 끌어올리는 흐름을 그대로 따라가 볼게요. 전체 과정은 추론 확인 → 튜닝 → 튜닝된 모델 사용 순서예요.
설정
SDK를 설치하고 API 키(무료 크레딧 $300)를 받아 환경변수로 설정해요.
pip install --upgrade lamini
export LAMINI_API_KEY="<YOUR-LAMINI-API-KEY>"
키는 https://app.lamini.ai/account 에서 발급받아요.
추론 확인
from lamini import Lamini
llm = Lamini("meta-llama/Llama-3.2-3B-Instruct")
print(
llm.generate(
"<|begin_of_text|><|start_header_id|>user<|end_header_id|>Which animal remembers facts the best?<|eot_id|><|start_header_id|>assistant<|end_header_id|>"
)
)
위 질문에 대한 답이 장황하고 부정확하죠. 그래서 다음으로 Memory Tune을 해요.
Memory Tune
입출력 쌍으로 이뤄진 data를 준비해 llm.tune(data_or_dataset_id=data)로 튜닝 잡을 시작해요. 잡 상태는 llm.get_jobs()[0]로 확인하고, 상태가 "COMPLETED"가 되면 튜닝된 model_name으로 다시 추론하면 정확한 답(A llama!)이 나와요.
참고: 문서도 강조하지만, 튜닝 전에 데이터를 깊이 이해하고 제대로 준비하는 게 정확도를 좌우해요.