通義實驗室基於預訓練多模態大模型構建的多模態向量模型。該模型根據使用者的輸入產生高維連續向量,這些輸入可以是文本、圖片或視頻。多模態向量在可應用於圖片搜尋、文搜圖、視頻搜尋、圖片分類和視頻內容審核等下遊任務中。
推理服務供應商
multimodal-embedding-v1模型的推理服務供應商為阿里雲百鍊。
模型能力
| 能力項 | 支援情況 | 能力項 | 支援情況 |
|---|---|---|---|
輸入模態 | Text Image Video | 輸出模態 | — |
模型體驗 | 不支援 | Function Calling | 不支援 |
結構化輸出 | 不支援 | 連網搜尋 | 不支援 |
首碼續寫 | 不支援 | 上下文緩衝 | 不支援 |
批量推理 | 不支援 | 模型調優 | 不支援 |
上下文限制
| 參數 | 值 | 參數 | 值 |
|---|---|---|---|
最大輸入長度 | 512 | 最大輸出長度 | 0 |
上下文長度 | 0 |
限流
- 華北2(北京)
| 參數 | 值 |
|---|---|
RPM(每分鐘請求數) | 120 |
TPM(每分鐘tokens) | 1,000,000 |