임베딩 생성하기
임베딩 생성하기
파이썬 클라이언트에서 nomic 패키지의 embed.text 함수로 임베딩을 만들어요. API 시그니처는 이렇게 생겼어요.
def text(texts: list[str],
*,
model: str = "nomic-embed-text-v1.5",
task_type: str = "search_document",
dimensionality: int | None = None,
long_text_mode: str = "truncate",
inference_mode: str = "remote",
device: str | None = None,
**kwargs: Any) -> dict[str, Any]
기본 예제는 다음과 같아요.
from nomic import embed
output = embed.text(
texts=['Nomic Embedding API', '#keepAIOpen'],
model='nomic-embed-text-v1.5',
task_type='search_document',
)
texts: 임베딩할 텍스트 리스트.model: 사용할 모델. 기본은nomic-embed-text-v1.5.task_type:search_query,search_document,classification,clustering중 하나.dimensionality: Matryoshka 지원 모델의 임베딩 차원. 기본은 전체 크기.long_text_mode: 모델이 수용하는 길이보다 긴 텍스트 처리 방식.mean또는truncate.inference_mode:remote(Nomic API),local(GPT4All),dynamic(자동) 중 하나. 기본은remote.device: 로컬 추론용 장치. 기본은 CPU(Apple Silicon은 Metal).gpu,amd,nvidia또는 특정 장치 이름 가능.
반환값은 임베딩과 요청 메타데이터를 담은 dict예요. 반환에서 output['embeddings']로 벡터 배열을 꺼내 쓰면 되죠.