Nemotron-4-340B를 NIM으로 추론하기

Nemotron-4-340B를 NIM으로 추론하기

Nemotron-4-340B-Instruct는 엔비디아의 NIM(NVIDIA Inference Microservice) 로 바로 서빙할 수 있어요. build.nvidia.com에서 OpenAI 호환 API로 접근해서 기존 OpenAI SDK를 그대로 쓸 수 있다는 점이 장점이에요.

출처: NVIDIA NIM: nemotron-4-340b-instruct

OpenAI 호환 호출

from openai import OpenAI

client = OpenAI(
  base_url="https://integrate.api.nvidia.com/v1",
  api_key="$NVIDIA_API_KEY",
)

completion = client.chat.completions.create(
  model="nvidia/nemotron-4-340b-instruct",
  messages=[{"role": "user", "content": "Hello!"}],
  temperature=0.5,
  top_p=0.7,
  max_tokens=1024,
  stream=True,
)

for chunk in completion:
  if chunk.choices[0].delta.content is not None:
    print(chunk.choices[0].delta.content, end="")

이 NIM이 좋은 이유

  • 네이티브 추론 마이크로서비스로 호출 지연이 짧고 보안이 강화돼 있어요.
  • 합성 데이터 생성 워크플로우에서 LLM을 만들어내는 '생성기' 역할로 자주 쓰여요.
  • 기존 RAG·에이전트 파이프라인에 그대로 통합할 수 있어요.

더 알아보기