Cohere의 Embed 모델
Cohere의 Embed 모델 (세부 사항 및 응용)
Embed 모델을 사용해 영어와 여러 언어의 텍스트 분류와 임베딩 생성을 수행할 수 있어요. 차원과 엔드포인트에 대한 세부 정보도 함께 확인할 수 있습니다.
출처: 문서
본문
Embed 모델은 텍스트에서 임베딩을 생성하거나 다양한 파라미터를 바탕으로 텍스트를 분류하는 데 사용할 수 있어요. 임베딩은 두 텍스트 사이의 의미론적 유사성을 추정하거나, 어떤 문장이 다른 문장 뒤에 이어질 가능성이 가장 높은지 선택하거나, 사용자 피드백을 범주화하는 데 사용할 수 있죠. Classify 엔드포인트와 함께 사용하면 임베딩은 어떤 분류 또는 분석 작업에도 사용할 수 있습니다.
| 최신 모델(Latest Model) | 설명(Description) | 모달리티(Modality) | 차원(Dimensions) | 최대 토큰(컨텍스트 길이, Max Tokens (Context Length)) | 유사성 지표(Similarity Metric) | 엔드포인트(Endpoints) |
|---|---|---|---|---|---|---|
embed-v4.0 |
텍스트와 이미지를 분류하거나 임베딩으로 변환할 수 있는 모델 | 텍스트, 이미지, 혼합 텍스트/이미지(예: PDF) | '[256, 512, 1024, 1536 (기본값, default)]' 중 하나 | 128k | 코사인 유사도(Cosine Similarity), 내적 유사도(Dot Product Similarity), 유클리드 거리(Euclidean Distance) | Embed |
embed-english-v3.0 |
텍스트를 분류하거나 임베딩으로 변환할 수 있는 모델. 영어 전용. | 텍스트, 이미지 | 1024 | 512 | 코사인 유사도, 내적 유사도, 유클리드 거리 | Embed, Embed Jobs |
embed-english-light-v3.0 |
embed-english-v3.0의 더 작고 빠른 버전. 거의 같은 성능이지만 훨씬 빠름. 영어 전용. |
텍스트, 이미지 | 384 | 512 | 코사인 유사도, 내적 유사도, 유클리드 거리 | Embed, Embed Jobs |
embed-multilingual-v3.0 |
다국어 분류와 임베딩 지원을 제공. 지원 언어 보기. | 텍스트, 이미지 | 1024 | 512 | 코사인 유사도, 내적 유사도, 유클리드 거리 | Embed, Embed Jobs |
embed-multilingual-light-v3.0 |
embed-multilingual-v3.0의 더 작고 빠른 버전. 거의 같은 성능이지만 훨씬 빠름. 여러 언어 지원. |
텍스트, 이미지 | 384 | 512 | 코사인 유사도, 내적 유사도, 유클리드 거리 | Embed, Embed Jobs |
지원 언어 목록(List of Supported Languages)
우리의 다국어 Embed 모델은 중국어, 스페인어, 프랑스어를 포함해 100개 이상의 언어를 지원해요.
| ISO 코드(ISO Code) | 언어 이름(Language Name) |
|---|---|
| af | Afrikaans |
| am | Amharic |
| ar | Arabic |
| as | Assamese |
| az | Azerbaijani |
| be | Belarusian |
| bg | Bulgarian |
| bn | Bengali |
| bo | Tibetan |
| bs | Bosnian |
| ca | Catalan |
| ceb | Cebuano |
| co | Corsican |
| cs | Czech |
| cy | Welsh |
| da | Danish |
| de | German |
| el | Greek |
| en | English |
| eo | Esperanto |
| es | Spanish |
| et | Estonian |
| eu | Basque |
| fa | Persian |
| fi | Finnish |
| fr | French |
| fy | Frisian |
| ga | Irish |
| gd | Scots_gaelic |
| gl | Galician |
| gu | Gujarati |
| ha | Hausa |
| haw | Hawaiian |
| he | Hebrew |
| hi | Hindi |
| hmn | Hmong |
| hr | Croatian |
| ht | Haitian_creole |
| hu | Hungarian |
| hy | Armenian |
| id | Indonesian |
| ig | Igbo |
| is | Icelandic |
| it | Italian |
| ja | Japanese |
| jv | Javanese |
| ka | Georgian |
| kk | Kazakh |
| km | Khmer |
| kn | Kannada |
| ko | Korean |
| ku | Kurdish |
| ky | Kyrgyz |
| La | Latin |
| Lb | Luxembourgish |
| Lo | Laothian |
| Lt | Lithuanian |
| Lv | Latvian |
| mg | Malagasy |
| mi | Maori |
| mk | Macedonian |
| ml | Malayalam |
| mn | Mongolian |
| mr | Marathi |
| ms | Malay |
| mt | Maltese |
| my | Burmese |
| ne | Nepali |
| nl | Dutch |
| no | Norwegian |
| ny | Nyanja |
| or | Oriya |
| pa | Punjabi |
| pl | Polish |
| pt | Portuguese |
| ro | Romanian |
| ru | Russian |
| rw | Kinyarwanda |
| si | Sinhalese |
| sk | Slovak |
| sl | Slovenian |
| sm | Samoan |
| sn | Shona |
| so | Somali |
| sq | Albanian |
| sr | Serbian |
| st | Sesotho |
| su | Sundanese |
| sv | Swedish |
| sw | Swahili |
| ta | Tamil |
| te | Telugu |
| tg | Tajik |
| th | Thai |
| tk | Turkmen |
| tl | Tagalog |
| tr | Turkish |
| tt | Tatar |
| ug | Uighur |
| uk | Ukrainian |
| ur | Urdu |
| uz | Uzbek |
| vi | Vietnamese |
| wo | Wolof |
| xh | Xhosa |
| yi | Yiddish |
| yo | Yoruba |
| zh | Chinese |
| zu | Zulu |
자주 묻는 질문(Frequently Asked Questions)
Cohere 임베딩 모델의 컨텍스트 길이는 얼마인가요?
다양한 Cohere 임베딩 모델의 컨텍스트 길이는 위 표에서 확인할 수 있어요. "최대 토큰(컨텍스트 길이, Max Tokens (Context Length))" 열에 있습니다.