Lamini 빠른 시작 — 추론과 Memory Tune

Lamini 빠른 시작

문서에서 '작은 LLM을 50%에서 90%+ 정확도로' 끌어올리는 흐름을 그대로 따라가 볼게요. 전체 과정은 추론 확인 → 튜닝 → 튜닝된 모델 사용 순서예요.

설정

SDK를 설치하고 API 키(무료 크레딧 $300)를 받아 환경변수로 설정해요.

pip install --upgrade lamini
export LAMINI_API_KEY="<YOUR-LAMINI-API-KEY>"

키는 https://app.lamini.ai/account 에서 발급받아요.

추론 확인

from lamini import Lamini

llm = Lamini("meta-llama/Llama-3.2-3B-Instruct")

print(
    llm.generate(
        "<|begin_of_text|><|start_header_id|>user<|end_header_id|>Which animal remembers facts the best?<|eot_id|><|start_header_id|>assistant<|end_header_id|>"
    )
)

위 질문에 대한 답이 장황하고 부정확하죠. 그래서 다음으로 Memory Tune을 해요.

Memory Tune

입출력 쌍으로 이뤄진 data를 준비해 llm.tune(data_or_dataset_id=data)로 튜닝 잡을 시작해요. 잡 상태는 llm.get_jobs()[0]로 확인하고, 상태가 "COMPLETED"가 되면 튜닝된 model_name으로 다시 추론하면 정확한 답(A llama!)이 나와요.

참고: 문서도 강조하지만, 튜닝 전에 데이터를 깊이 이해하고 제대로 준비하는 게 정확도를 좌우해요.

더 알아보기