檢索系統在“召回”階段為保證效率,返回的結果可能不夠精準。排序模型能對召回的文檔進行二次精準排序,確保將與使用者查詢最相關的結果排在最前,有效提升應用準確率。
模型概覽
- 新加坡
- 北京
模型名稱 | 最大文檔數 | 單條最大輸入Token | 請求最大輸入Token | 語種支援 | 應用情境 |
|---|---|---|---|---|---|
qwen3-rerank | 500 | 4,000 | 120,000 | 中文、英語、西班牙語、法語、葡萄牙語、印尼語、日語、韓語、德語、俄羅斯語等100+主流語種 |
|
- 單條最大輸入Token:每個Query或Document的最大Token數量。單條 Query 或 Document 的輸入超過該限制時,API 會傳回 HTTP 400 錯誤,不會截斷輸入內容。
- 單次請求最大文檔數:單次請求允許的最大文檔數量。對於 qwen3-vl-rerank 模型,該限制會根據文件類型(文本、圖片、視頻、混合模態)的不同而有所差異。
- 請求最大輸入Token:計算公式為
Query Tokens × Document 數量 + Document Tokens 總和,該值不得超過請求最大輸入Token。
輸入格式限制:
模型 | 圖片 | 視頻 |
|---|---|---|
qwen3-vl-rerank | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支援URL或Base64) | MP4, AVI, MOV(僅支援URL) |
前提條件
您需要已擷取 API Key並配置API Key到環境變數DASHSCOPE_API_KEY。如果通過SDK調用,還需要安裝DashScope SDK。
HTTP調用
不同模型使用不同的API介面:
- qwen3-rerank:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-api/v1/reranks - qwen3-vl-rerank / gte-rerank-v2:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/rerank/text-rerank/text-rerank
{WorkspaceId}替換為真實的業務空間ID。
兩種介面的請求體結構和響應格式不同,請參考對應模型的請求樣本和響應樣本。
請求要求標頭(Headers)Content-Typestring(必選)請求內容類型。此參數必須設定為application/json。Authorizationstring(必選)請求身份認證。介面使用阿里雲百鍊API Key進行身份認證。樣本值:Bearer sk-xxxx。請求體(Request Body)modelstring(必選)模型名稱。支援的模型:qwen3-rerank、gte-rerank-v2、qwen3-vl-rerank。inputobject(必選)輸入內容。當使用
屬性 query string | object(必選)查詢內容。最大長度不能超過4,000個Token。當使用qwen3-vl-rerank模型時,query支援以下兩種格式:
array(必選)待排序的候選文檔列表。每個元素是一個字串。當使用qwen3-vl-rerank模型時,每個元素是一個字典或者字串,用於指定內容的類型和值。格式為{"模態類型": "輸入字串或映像、視頻url"}。支援text, image, video三種模態類型。
object(可選)選擇性參數。當使用
屬性 top_n int(可選)返回排序後的top_n個文檔。預設返回全部文檔。如果指定的值大於文檔總數,將返回全部文檔。return_documentsbool(可選)是否在排序結果中返迴文檔原文。預設值false,以減少網路傳輸開銷。支援的模型:gte-rerank-v2、qwen3-vl-rerank。instruct string 可選添加自訂排序任務類型說明,僅在使用 qwen3-rerank 及qwen3-vl-rerank模型時生效。通過該參數可以指導模型採用不同的排序策略,例如:
float 可選僅qwen3-vl-rerank模型支援此參數。控制視頻的幀數,比例越小,實際抽取的幀數越少,範圍為 [0,1]。預設值為1.0。 |
調用時請將 |
響應request_idstring請求唯一標識。可用於請求明細溯源和問題排查。outputobject任務輸出資訊。當使用
屬性 results array排序結果清單。按 relevance_score 從高到低排列。
屬性 document dict文檔原文對象。僅在請求參數 return_documents 為 true 時返回。結構為 {"text": "文檔原文"}。indexint表示該結果對應於輸入 documents 列表中的原始索引位置。relevance_scoredouble該文檔與查詢的語義相關性得分,取值範圍為 0.0 到 1.0。分數越高,相關性越強。此分數為當前請求中的相對分數,主要用於對本次請求內的文檔排序,不可作為跨請求比較的絕對值。 object輸出資訊統計。
屬性 total_tokens int本次請求消耗的總 Token 數量。string請求失敗的錯誤碼。請求成功時不會返回此參數,詳情請參見錯誤碼。messagestring請求失敗的詳細資料。請求成功時不會返回此參數,詳情請參見錯誤碼。 |
|
SDK調用
調用樣本
以下樣本展示了調用文檔排序模型API的程式碼範例。
SDK 的參數命名與HTTP介面基本一致,參數結構進行了一定封裝。比如 HTTP 使用嵌套的input和parameters結構,但SDK 使用扁平參數。請在開發時注意區分。
qwen3-vl-rerank模型進行多模態排序(以圖片作為查詢)的程式碼範例。
輸出樣本
SDK對原始HTTP響應進行了封裝,成功時會固定返回
code和message欄位,值為空白字串。