向量化模型可將文本、映像、視頻等資料轉換為數值向量,用於語義搜尋、推薦、聚類、分類、異常檢測等下遊任務。
準備工作
您需要已擷取與配置 API Key並配置API Key到環境變數。如果通過OpenAI SDK或DashScope SDK進行調用,還需要安裝SDK。請將範例程式碼中的 DASHSCOPE_API_HOST 替換為擷取的 API Host。
擷取Embedding
- 文本資訊向量
- 多模態獨立向量
- 多模態融合向量
- OpenAI相容介面
- DashScope
模型選擇
選擇合適的模型取決於您的輸入資料類型和應用情境。
-
處理純文字或代碼:推薦使用
qwen3.7-text-embedding。它是當前效能最強的模型,支援任務指令(instruct)、稀疏向量等進階功能,能覆蓋絕大多數文本處理情境。 -
處理多模態內容:
- 融合向量:若要將單模態或混合模態輸入表徵為融合向量,適用於跨模態檢索、圖搜等情境,可使用
qwen3-vl-embedding。例如,輸入一張襯衫圖片並附加文本”找相似風格但更顯年輕的款式”,模型能將映像和文本指令融合成一個向量進行理解。 - 獨立向量:若要為每個輸入(如圖片和其對應的文字標題)產生獨立的向量,可選擇
tongyi-embedding-vision-plus、tongyi-embedding-vision-flash或通用多模態模型multimodal-embedding-v1為每個輸入部分(圖片、文字)產生一個獨立的向量。
- 融合向量:若要將單模態或混合模態輸入表徵為融合向量,適用於跨模態檢索、圖搜等情境,可使用
-
處理大規模資料:若您需要處理大規模、非即時的文本資料,建議使用
qwen3.7-text-embedding或text-embedding-v4並結合 OpenAI相容-Batch調用,以顯著降低成本。
文本向量
- 北京
- 中國香港
- 新加坡
| 模型名稱 | 向量維度 | 批次大小 | 單批次最大Token數(注) | 單價(每百萬輸入Token) | 支援語種 |
|---|---|---|---|---|---|
text-embedding-v4屬於Qwen3-Embedding系列 | 2,048、1,536、1,024(預設)、768、512、256、128、64 | 10 | 8,192 | $0.072 | 中文、英語、西班牙語、法語、葡萄牙語、印尼語、日語、韓語、德語、俄羅斯語等100+主流語種及多種編程 |
- 字串數組輸入:數組最多包含10個元素。
- 檔案輸入:文字檔最多包含10行文本。
多模態向量
模型根據使用者的輸入產生連續向量,這些輸入可以是文本、圖片或視頻。適用於視頻分類、映像分類、圖文檢索,以文/圖搜圖,以文/圖搜視頻等任務情境。
介面支援單段文本、單張圖片或單個視頻檔案的上傳,也允許不同類型組合(如文本+圖片),部分模型支援同類型內容的多個輸入(如多張圖片),請參考具體模型的限制說明。
- 新加坡
- 北京
模型名稱 | 向量維度 | 文本長度限制 | 圖片大小限制 | 視頻大小限制 | 單價(每百萬輸入Token) | 免費額度(注) |
|---|---|---|---|---|---|---|
tongyi-embedding-vision-plus | 1152 | 1,024 Token | 單張大小不超過3 MB。支援多圖,最多支援輸入8張 | 視頻檔案大小不超過 10 MB | 圖片/視頻:$0.09 文本:$0.09 | 100萬Token 有效期間:自開通百鍊/模型發布/申請通過之日起90天(以較晚者為準) |
tongyi-embedding-vision-flash | 768 | 圖片/視頻:$0.03 文本:$0.09 |
輸入與語種限制
| 多模態融合向量模型 | ||||
|---|---|---|---|---|
| 模型 | 文本 | 圖片 | 視頻 | 單次請求條數 |
| qwen3-vl-embedding | 支援中、英、日、韓、法、德等33種主流語言
所有支援語言 中文、日語、韓語、印尼語、越南語、泰語、英語、法語、德語、俄語、葡萄牙語、西班牙語、意大利語、瑞典語、丹麥語、捷克語、挪威語、荷蘭語、芬蘭語、土耳其語、波蘭語、斯瓦希裡語、羅馬尼亞語、塞爾維亞語、希臘語、哈薩克語、烏茲別克語、宿務語、阿拉伯語、烏爾都語、波斯語、印地語 / 天城語、希伯來語。 | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支援URL或Base64) | MP4, AVI, MOV(僅支援URL) | 一次請求中傳入內容元素總數不超過 20;圖片數量不超過5;圖片、文本、視頻共用該上限。 |
| 多模態獨立向量模型 | ||||
| 模型 | 文本 | 圖片 | 視頻 | 單次請求條數 |
| tongyi-embedding-vision-plus | 中/英文 | JPG, PNG, BMP (支援URL或Base64) | MP4, MPEG, AVI, MOV, MPG, WEBM, FLV, MKV(僅支援URL) | 暫無傳入內容元素數量限制,輸入內容總Token數不超過Token數量上限即可。 |
| tongyi-embedding-vision-flash | ||||
| multimodal-embedding-v1 | 一次請求中傳入內容元素總數不超過 20;圖片、視頻各最多 1 條,文本最多 20 條,共用總條數上限。 | |||
核心功能
切換向量維度
qwen3.7-text-embedding、text-embedding-v4 、 text-embedding-v3、tongyi-embedding-vision-plus、tongyi-embedding-vision-flash、qwen3-vl-embedding支援自訂向量維度。更高的維度能保留更豐富的語義資訊,但也會相應增加儲存和計算成本。
- 通用情境(推薦):1024 維度是效能與成本的最佳平衡點,適用於絕大多數語義檢索任務。
- 追求精度:對於高精度要求領域,可選擇 1536 或 2048 維度。這會帶來一定的精度提升,但儲存和計算開銷會顯著增加。
- 資源受限:在對成本極其敏感的情境下,可選擇 768 及以下維度。這能顯著降低資源消耗,但會損失部分語義資訊。
區分查詢與文檔文本 (text_type)
該參數目前僅支援通過DashScope SDK及API啟用。為了在搜尋類任務中取得最佳效果,應根據任務目標對不同的內容進行有針對性的向量化處理,以充分發揮各自的作用。
text_type 參數正是為此設計:
text_type: 'query':用於使用者輸入的查詢文本。模型將產生一個類似“標題”的向量,更具方向性,專為“提問”和“尋找”進行最佳化。text_type: 'document'(預設值):用於存入底庫的文檔文本。模型將產生一個類似“本文”的向量,包含更全面的資訊,專為“被匹配”進行最佳化。
query 和 document。而在聚類、分類等所有文本處於相同角色的任務中,則無需設定此參數。
使用任務指令提升效果 (instruct)
該參數目前僅支援通過DashScope SDK及API啟用。通過提供明確的英文任務指令(instruct),可以引導
qwen3.7-text-embedding 和 text-embedding-v4 模型針對特定檢索情境最佳化向量品質,有效提升精度。其中 qwen3.7-text-embedding 在指令遵循能力上對比 text-embedding-v4 提升了 16.4%,建議優先使用。使用此功能時,必須將 text_type 參數設定為 query。
稠密與稀疏向量
該參數目前僅支援通過DashScope SDK及API啟用。
qwen3.7-text-embedding、text-embedding-v4和text-embedding-v3支援輸出三種類型的向量,以適應不同檢索策略的需求。其中 qwen3.7-text-embedding 的 Sparse Embedding 採用全新類 SPLADE 訓練策略,效果提升 8.4%,並新增跨語言檢索支援。
向量類型 (output_type) | 核心優勢 | 主要不足 | 典型應用情境 |
|---|---|---|---|
dense | 深度語義理解,能識別同義字和上下文,與召回結果更相關。 | 計算和儲存成本較高;無法保證關鍵詞的精確匹配。 | 語義搜尋、智能問答、內容推薦。 |
sparse | 高計算效率,專註於關鍵詞的精確匹配和快速過濾。 | 犧牲了語義理解能力,無法處理同義字或上下文。 | 日誌檢索、商品SKU搜尋、精確資訊過濾。 |
dense&sparse | 結合語義與關鍵詞,搜尋效果最好。產生成本不變,API調用開銷與單向量模式相同。 | 儲存需求大,系統架構和檢索邏輯更複雜。 | 高品質、生產級的混合搜尋引擎。 |
應用樣本
以下為功能示範代碼。在生產環境中,請預先計算向量並持久化儲存在向量資料庫中,檢索時僅需計算查詢向量。
語義搜尋
通過計算查詢與文檔之間的向量相似性,實現精準的語義匹配。
推薦系統
通過分析使用者歷史行為向量,發現使用者的興趣偏好並推薦相似物品。
文本聚類
通過分析向量間的距離,將相似的文本自動分組。
文本分類
通過計算輸入文本與預定義標籤的向量相似性,實現在沒有預先標記的樣本的情況下,對新類別進行識別和分類。
異常檢測
通過計算文本向量與正常樣本中心的向量相似性,識別出與常規模式顯著不同的異常資料。
範例程式碼中的閾值(threshold)僅為示範目的。在真實業務情境中,相似性的具體數值會因資料內容和分布的不同而變化,沒有一個固定的閾值。建議基於自己的資料集來校準此值。
API參考
- 通用文本向量
- 多模態向量 多模態向量模型介面API詳情
錯誤碼
如果模型調用失敗並返回報錯資訊,請參見錯誤碼進行解決。
限流
關於模型的限流條件,請參見限流。
模型效能(MTEB/CMTEB)
評測基準
- MTEB:大規模文本嵌入評測基準,綜合評估分類、聚類、檢索等任務的通用性。
- CMTEB:中文大規模文本嵌入評測基準,專門針對中文文本的評測。
- 分數範圍0-100,數值越高代表效果越優。
模型 | MTEB | MTEB(Retrieval task) | CMTEB | CMTEB (Retrieval task) |
|---|---|---|---|---|
text-embedding-v3(512維度) | 62.11 | 54.30 | 66.81 | 71.88 |
text-embedding-v3(768維度) | 62.43 | 54.74 | 67.90 | 72.29 |
text-embedding-v3(1024維度) | 63.39 | 55.41 | 68.92 | 73.23 |
text-embedding-v4(512維度) | 64.73 | 56.34 | 68.79 | 73.33 |
text-embedding-v4(1024維度) | 68.36 | 59.30 | 70.14 | 73.98 |
text-embedding-v4(2048維度) | 71.58 | 61.97 | 71.99 | 75.01 |