Nemotron-4-340B를 NIM으로 추론하기
Nemotron-4-340B를 NIM으로 추론하기
Nemotron-4-340B-Instruct는 엔비디아의 NIM(NVIDIA Inference Microservice) 로 바로 서빙할 수 있어요. build.nvidia.com에서 OpenAI 호환 API로 접근해서 기존 OpenAI SDK를 그대로 쓸 수 있다는 점이 장점이에요.
OpenAI 호환 호출
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="$NVIDIA_API_KEY",
)
completion = client.chat.completions.create(
model="nvidia/nemotron-4-340b-instruct",
messages=[{"role": "user", "content": "Hello!"}],
temperature=0.5,
top_p=0.7,
max_tokens=1024,
stream=True,
)
for chunk in completion:
if chunk.choices[0].delta.content is not None:
print(chunk.choices[0].delta.content, end="")
이 NIM이 좋은 이유
- 네이티브 추론 마이크로서비스로 호출 지연이 짧고 보안이 강화돼 있어요.
- 합성 데이터 생성 워크플로우에서 LLM을 만들어내는 '생성기' 역할로 자주 쓰여요.
- 기존 RAG·에이전트 파이프라인에 그대로 통합할 수 있어요.