임베딩 생성하기

임베딩 생성하기

파이썬 클라이언트에서 nomic 패키지의 embed.text 함수로 임베딩을 만들어요. API 시그니처는 이렇게 생겼어요.

def text(texts: list[str],
         *,
         model: str = "nomic-embed-text-v1.5",
         task_type: str = "search_document",
         dimensionality: int | None = None,
         long_text_mode: str = "truncate",
         inference_mode: str = "remote",
         device: str | None = None,
         **kwargs: Any) -> dict[str, Any]

기본 예제는 다음과 같아요.

from nomic import embed
output = embed.text(
    texts=['Nomic Embedding API', '#keepAIOpen'],
    model='nomic-embed-text-v1.5',
    task_type='search_document',
)
  • texts: 임베딩할 텍스트 리스트.
  • model: 사용할 모델. 기본은 nomic-embed-text-v1.5.
  • task_type: search_query, search_document, classification, clustering 중 하나.
  • dimensionality: Matryoshka 지원 모델의 임베딩 차원. 기본은 전체 크기.
  • long_text_mode: 모델이 수용하는 길이보다 긴 텍스트 처리 방식. mean 또는 truncate.
  • inference_mode: remote(Nomic API), local(GPT4All), dynamic(자동) 중 하나. 기본은 remote.
  • device: 로컬 추론용 장치. 기본은 CPU(Apple Silicon은 Metal). gpu, amd, nvidia 또는 특정 장치 이름 가능.

반환값은 임베딩과 요청 메타데이터를 담은 dict예요. 반환에서 output['embeddings']로 벡터 배열을 꺼내 쓰면 되죠.

더 알아보기