檢索系統優先保證速度,因此結果的精確度可能不夠理想。重排序模型對檢索到的文檔重新打分,將最相關的結果排在前面,顯著提升搜尋精度。
重排序最能發揮價值的情境:當初始檢索返回 20-100+ 個相關度參差不齊的候選結果時,重排序的精度提升最為顯著。如果檢索已返回高度相關的結果(如精確關鍵詞匹配),則重排序的價值較小。典型的 RAG 流程:先通過 Embedding 檢索 50-100 個候選結果,再通過重排序篩選 Top 5-10,最後傳入大語言模型。
前提條件
請先擷取API Key並配置API Key到環境變數。如需使用 SDK,請安裝SDK。
重排序文檔
將查詢和候選文檔列表傳給 API,模型將按相關性對文檔進行排序後返回。
文本重排序(qwen3-rerank)
- OpenAI 相容
- DashScope
多模態重排序(qwen3-vl-rerank)
qwen3-vl-rerank 支援文本、圖片和視頻的混合排序。查詢可以是文本或圖片,文檔可以包含文本、圖片和視頻。
多模態重排序需要使用 DashScope SDK 或 API,不支援 OpenAI 相容介面。
Python
核心功能
使用指令提升排序效果(instruct)
instruct 參數可以引導模型使用不同的排序策略。請使用英文編寫指令。
-
問答檢索(預設):
"Given a web search query, retrieve relevant passages that answer the query."側重於尋找答案。對於查詢"如何預防感冒?","勤洗手可預防感冒"的分數會高於"感冒是一種常見病"(主題相關但未回答問題)。 -
語義相似性:
"Retrieve semantically similar text."側重於語義等價,不受措辭影響。例如:"如何修改密碼?"可匹配"忘記密碼怎麼辦?"(FAQ 情境)。
OpenAI 相容
返回前 N 個結果(top_n)
使用 top_n 僅返回排名最高的文檔。如未設定,則返回按相關性排序的所有文檔。如果 top_n 超過文檔總數,則返回所有文檔。
模型概覽
- 新加坡
- 北京
模型 | 最大文檔數 | 單條最大 Token 數 | 單次請求最大 Token 數 | 支援語言 | 適用情境 |
|---|---|---|---|---|---|
qwen3-rerank | 500 | 4,000 | 120,000 | 100+ 語言 | 語義文本搜尋、RAG 應用 |
- 單條最大 Token 數:單條查詢或文檔的最大 Token 數。單條查詢或文檔的輸入超過該限制時,API 會傳回 HTTP 400 錯誤,不會截斷輸入內容。
- 單次請求最大文檔數:單次請求允許的最大文檔數量。對於 qwen3-vl-rerank 模型,該限制會根據文件類型(文本、圖片、視頻、混合模態)的不同而有所差異。
- 單次請求最大 Token 數:計算公式為
查詢 Token 數 x 文檔數量 + 所有文檔 Token 總數,該值不能超過單次請求上限。