多模態向量模型將文本、映像和視頻轉換為同一語義空間中的向量表示,支援跨模態檢索、內容分類和語義相似性計算。
核心能力
- 跨模態檢索:以文搜圖、以圖搜視頻、以圖搜圖等跨模態語義搜尋。
- 語義相似性計算:在統一向量空間中衡量不同模態內容之間的語義相似性。
- 內容分類與聚類:基於語義向量進行智能分組、打標和群集。
關鍵特性 :所有模態(文本、圖片、視頻)的向量均位於同一語義空間,可通過餘弦相似性等方法直接進行跨模態匹配與比較。模型選型和使用方法詳見 文本與多模態向量化 。
向量類型說明
多模態向量模型支援兩種向量產生方式:
- 多模態獨立向量:為 contents 中的每個輸入(文本、圖片、視頻、多圖)分別產生獨立向量。例如,輸入 1 段文本和 1 張圖片,返回 2 個獨立向量。適用於逐項對比不同內容的情境,如以圖搜圖、以文搜圖。
-
多模態融合向量:將 contents 中的所有輸入融合為 1 個向量,實現跨模態綜合語義表徵。適用於需要整體理解多模態內容的情境,如將商品圖片和描述文本融合為統一表徵進行檢索。
qwen3-vl-embedding通過設定enable_fusion=true開啟融合模式。融合向量支援以下組合:- 文本 + 圖片融合
- 文本 + 視頻融合
- 多圖 + 文本融合(傳入多個 image 條目)
- 圖片 + 視頻 + 文本混合融合
模型介紹、選型建議和使用方法,請參考文本與多模態向量化。qwen2.5-vl-embedding僅支援融合向量,不支援獨立向量。tongyi-embedding-vision-plus和tongyi-embedding-vision-flash僅支援獨立向量。
模型概覽
- 新加坡
- 北京
模型名稱 | 向量維度 | 文本長度限制 | 圖片大小限制 | 視頻大小限制 | 單價(每百萬輸入Token) | 免費額度(注) |
|---|---|---|---|---|---|---|
tongyi-embedding-vision-plus | 1152 | 1,024 Token | 單張大小不超過3 MB。支援多圖,最多支援輸入8張 | 視頻檔案大小不超過 10 MB | 圖片/視頻:$0.09 文本:$0.09 | 100萬Token 有效期間:自開通百鍊/模型發布/申請通過之日起90天(以較晚者為準) |
tongyi-embedding-vision-flash | 768 | 圖片/視頻:$0.03 文本:$0.09 |
輸入格式與語種限制:
| 多模態融合向量模型 | ||||
|---|---|---|---|---|
| 模型 | 文本 | 圖片 | 視頻 | 單次請求條數 |
| qwen3-vl-embedding | 支援中、英、日、韓、法、德等33種主流語言
所有支援語言 中文、日語、韓語、印尼語、越南語、泰語、英語、法語、德語、俄語、葡萄牙語、西班牙語、意大利語、瑞典語、丹麥語、捷克語、挪威語、荷蘭語、芬蘭語、土耳其語、波蘭語、斯瓦希裡語、羅馬尼亞語、塞爾維亞語、希臘語、哈薩克語、烏茲別克語、宿務語、阿拉伯語、烏爾都語、波斯語、印地語 / 天城語、希伯來語。 | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支援URL或Base64) | MP4, AVI, MOV(僅支援URL) | 一次請求中傳入內容元素總數不超過 20;圖片數量不超過5;圖片、文本、視頻共用該上限。 |
| 多模態獨立向量模型 | ||||
| 模型 | 文本 | 圖片 | 視頻 | 單次請求條數 |
| tongyi-embedding-vision-plus | 中/英文 | JPG, PNG, BMP (支援URL或Base64) | MP4, MPEG, AVI, MOV, MPG, WEBM, FLV, MKV(僅支援URL) | 暫無傳入內容元素數量限制,輸入內容總Token數不超過Token數量上限即可。 |
| tongyi-embedding-vision-flash | ||||
| multimodal-embedding-v1 | 一次請求中傳入內容元素總數不超過 20;圖片、視頻各最多 1 條,文本最多 20 條,共用總條數上限。 | |||
所有模型均支援 text、image、video 三種輸入類型及其組合。tongyi-embedding-vision-plus、tongyi-embedding-vision-flash額外支援multi_images多圖序列輸入。
模型能力對照
模型 | 預設維度 | 向量類型 | 支援的輸入 | 說明 |
qwen3-vl-embedding | 2560 | 獨立 / 融合 | text、image、video、多個 image 條目 | 通過 |
tongyi-embedding-vision-plus | 1152 | 僅獨立 | text、image、video、multi_images | 支援 multi_images 多圖序列(最多 8 張) |
tongyi-embedding-vision-flash | 768 | |||
multimodal-embedding-v1 | 1024 | text、image、video | 不支援 dimension 參數,固定 1024 維 |
前提條件
您需要已擷取與配置 API Key並配置API Key到環境變數。如果通過SDK調用,還需要安裝DashScope SDK。請將範例程式碼中的 DASHSCOPE_API_HOST 替換為擷取的 API Host。
HTTP調用
POST https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding
請求 |
以下樣本使用 |
要求標頭(Headers) | |
Content-Typestring(必選)請求內容類型。此參數必須設定為application/json。 | |
Authorizationstring(必選)請求身份認證。介面使用阿里雲百鍊API Key進行身份認證。樣本值:Bearer sk-xxxx。 | |
請求體(Request Body) | |
modelstring(必選)模型名稱。設定為模型概覽中的模型名稱。 | |
inputobject(必選)輸入內容。
屬性 contents array(必選)待處理的內容列表。每個元素是一個字典或者字串,用於指定內容的類型和值。格式為{"模態類型": "輸入字串或映像、視頻url"}。支援text, image, video和multi_images四種模態類型。
object (可選)向量處理參數。HTTP調用需封裝在parameters對象中,SDK調用可直接使用以下參數。
屬性 output_type string (可選)使用者指定輸出向量表示格式,目前僅支援dense。dimension integer (可選)用於使用者指定輸出向量維度。不同模型支援的值不同:
float (可選)控制視頻的幀數,比例越小,實際抽取的幀數越少,範圍為 [0,1]。預設值為1.0。instruct string (可選)添加自訂任務說明,可用於指導模型理解查詢意圖。建議使用英文撰寫,通常可帶來約 1%–5% 的效果提升。enable_fusion bool (可選)是否產生融合向量。僅 qwen3-vl-embedding 模型支援該參數。設定為 true 時,將 contents 中的所有多模態內容融合為 1 個向量;預設為 false,各模態獨立產生向量。融合向量支援文本+圖片、文本+視頻、多圖+文本(傳入多個 image 條目)、圖片+視頻+文本等組合,適用於需要綜合理解多模態內容的檢索情境。 |
響應 |
不同模型返回的 usage 欄位存在差異,請參考以下說明:
|
outputobject任務輸出資訊。
屬性 embeddings array向量結果清單,每個對象對應輸入列表中的一個元素。
屬性 index int結果在輸入列表中的索引。embeddingarray產生的向量數組,維度取決於模型及 dimension 參數設定。typestring結果對應的輸入類型。text、image、video、multi_images 分別對應文本、圖片、視頻、多圖輸入。以下為特殊類型: fusion 為 qwen3-vl-embedding模型在融合向量模式下返回的類型;vl 為 qwen3-vl-embedding 模型在獨立向量模式下返回的類型。 | |
request_idstring請求唯一標識。可用於請求明細溯源和問題排查。 | |
codestring請求失敗的錯誤碼。請求成功時不會返回此參數,詳情請參見錯誤碼。 | |
messagestring請求失敗的詳細資料。請求成功時不會返回此參數,詳情請參見錯誤碼。 | |
usageobject輸出資訊統計。
屬性 input_tokens int本次請求輸入內容的 Token 數目。對於 qwen3-vl-embedding 和 qwen2.5-vl-embedding 模型,該值僅包含文本 Token(含系統模板 Token),不包含圖片/視頻 Token;對於 tongyi-embedding-vision-* 系列模型,該值包含文本和圖片/視頻 Token 的總和。input_tokens_detailsobject輸入 Token 的詳細分類資訊。僅 tongyi-embedding-vision-* 系列模型返回此欄位,qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此欄位。
屬性 image_tokens int輸入內容中圖片或視頻等視覺部分消耗的 Token 數量,不包含文本(文本部分見 text_tokens)。圖片消耗的 Token 數量與輸入圖片的解析度有關,解析度越高消耗的 Token 越多;若輸入為視頻,系統會先對視頻抽幀,再基於抽幀結果計算 Token。text_tokensint輸入內容中文本部分消耗的 Token 數量(不包含圖片或視頻等視覺部分)。int本次請求輸出的 Token 數目。僅 tongyi-embedding-vision-* 系列模型返回此欄位,其他模型不返回此欄位。total_tokensint輸入與輸出的 Token 總數。對於 qwen3-vl-embedding 模型,total_tokens = input_tokens + image_tokens。僅 qwen3-vl-embedding 和 tongyi-embedding-vision-* 系列模型返回此欄位,qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此欄位。image_tokensint本次請求輸入的圖片或視頻等視覺部分消耗的 Token 數量(不包含文本)。圖片消耗的 Token 數量與輸入圖片的解析度有關;系統會對輸入視頻進行抽幀處理,幀數上限受系統配置控制,隨後基於處理結果計算 Token。僅 qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 返回此欄位(作為頂層欄位),tongyi-embedding-vision-* 系列模型的圖片 Token 包含在 input_tokens_details.image_tokens 中。image_countint本次請求輸入的圖片數量。僅 multimodal-embedding-v1 返回此欄位。durationint本次請求輸入的視頻時間長度(秒)。僅 multimodal-embedding-v1 返回此欄位。 |
SDK使用
SDK 的 input 參數對應HTTP請求體中的 input.contents,兩者結構 不一致 。
程式碼範例
- 圖片向量化樣本
- 視頻向量化樣本
- 文本向量化樣本
- 融合向量化樣本
- 多圖融合向量化樣本
- 2026-03-06 快照版本樣本
- 使用圖片URL
- 使用本地圖片