當您在嘗試如 Prompt 工程、外掛程式調用等最佳化方法後,模型表現仍然不及預期時,請使用阿里雲百鍊的模型調優。模型調優作為改進模型表現的核心策略,可以很好地提升模型在特定行業/業務的表現,對齊人類偏好,降低輸出延遲。模型調優包含模型微調(SFT)、繼續預訓練(CPT)、模型偏好訓練(DPO)三種模型訓練方式。
模型調優介紹
模型調優作為重要的模型效果最佳化方式,可以:
- 提升模型在特定行業/業務表現
- 降低模型輸出延遲
- 抑制模型幻覺
- 對齊人類的價值觀或偏好
- 使用調優後的輕量級模型替代規模更大的模型
模型調優流程
詳情參見:
支援的模型
支援的模型
支援的模型
- 新加坡
- 華北二(北京)
- 文本產生
- 視覺理解(千問VL)
模型名稱 | 模型代碼 | SFT全參訓練(sft) | SFT高效訓練(efficient_sft) |
|---|---|---|---|
Qwen3.5-27B | qwen3.5-27b | 支援 | 支援 |
Qwen3.5-9B | qwen3.5-9b | 支援 | 支援 |
Qwen3-14B | qwen3-14b | × | 支援 |
調優方法對比
特性 | CPT(持續預訓練) | SFT (監督微調) | DPO (直接偏好最佳化) |
|---|---|---|---|
一句話總結 | 補知識(注入領域知識) | 學做事(學會遵循指令) | 做得更好(對齊人類偏好) |
輸入資料 | 1000萬+ Token 無標籤的領域文本 | 1000+ 條 高品質的“問-答”對 | 100+ 組 同一指令下的“更好-更差”回答對 |
核心目標 | 領域適應,學習專業詞彙和事實 | 教會模型對話格式和任務執行能力 | 使模型輸出更符合人類價值觀和偏好 |
學習方式 | 自監督學習(預測下一個詞) | 監督學習(模仿標準答案) | 直接偏好學習(增大好答案機率,降低壞答案機率) |
模型階段 | 通常在 SFT 之前 | CPT 之後,DPO 之前 | 通常在 SFT 之後,作為對齊的最後一步 |
訓練模式對比
全參訓練 | 高效訓練 (LoRA,推薦) | |
|---|---|---|
適用情境 | • 需要模型學習新能力 • 追求全域效果最優 | • 最佳化模型特定情境下的效果 • 對訓練時間和成本敏感的情境 |
訓練時間 | 較長,收斂速度較慢。 | 較短,收斂速度快。 |
計費說明
| 計費方式 | 按訓練的資料量計費 |
| 計費公式 | 模型訓練費用 = (訓練資料 Token 總數 + 混合訓練資料 Token 總數)× 迴圈次數 × 訓練單價(最小計費單位:1 token)您可以查看模型調優控制台底部的預估訓練費用,並單擊计算详情,查看訓練 Token 總數、迴圈次數和訓練單價。 |
訓練單價
訓練單價
- 新加坡
- 華北二(北京)
- 千問
- 千問VL
模型服務 | 模型代碼 | 價格 |
|---|---|---|
Qwen3.5-27B | qwen3.5-27b | $0.0075/千Token |
Qwen3.5-9B | qwen3.5-9b | $0.003/千Token |
Qwen3-14B | qwen3-14b | $0.0016/千Token |
點擊此處查看更多千問 VL 模型使用限制
點擊此處查看更多千問 VL 模型使用限制
使用限制
輸入檔案限制
- 映像限制
- 視頻限制
-
映像解析度:
-
最小尺寸:映像的寬度和高度均須大於
10像素。 -
寬高比:原圖及縮放後的映像,長邊與短邊的比值不得超過
200:1。映像縮放邏輯請參見 計算映像的Token 中
smart_resize函數。 -
像素上限:
- 推薦將映像解析度控制在
8K(7680x4320)以內。超過此解析度的映像可能因檔案過大、網路傳輸耗時過長而導致API調用逾時。 - 自動縮放機制:模型可通過
max_pixels和min_pixels調整映像大小;因此,提供超高解析度的映像並不會提升識別精度,反而會增加調用失敗的風險,建議在用戶端提前將映像縮放至合理大小。
- 推薦將映像解析度控制在
-
最小尺寸:映像的寬度和高度均須大於
-
支援的映像格式
-
解析度在4K
(3840x2160)以下,支援的映像格式如下:映像格式
常見副檔名
MIME Type
BMP
.bmp
image/bmp
JPEG
.jpe, .jpeg, .jpg
image/jpeg
PNG
.png
image/png
TIFF
.tif, .tiff
image/tiff
WEBP
.webp
image/webp
HEIC
.heic
image/heic
-
解析度處於
4K(3840x2160)到8K(7680x4320)範圍,僅支援 JPEG、JPG 、PNG 格式
-
解析度在4K
-
映像大小:
- 以公網URL傳入時:Qwen3.8系列、Qwen3.7系列、Qwen3.6系列、Qwen3.5系列、Qwen3-VL系列單個映像不超過
20MB,其他模型單個映像不超過10MB - 以本地路徑傳入時:單個映像不超過
10MB - 以 Base 64 編碼傳入時(OpenAI 相容介面或DashScope):Qwen3.8系列、Qwen3.7系列、Qwen3.6系列、Qwen3.5、Qwen3-VL系列編碼前的原始影像檔不超過
20MB,其他模型不超過10MB;且編碼後的 Data URI 字串不超過20MB。 - 以 Base 64 編碼傳入時(Anthropic 相容介面):受請求體整體不超過
6MB的限制,多張映像時需共用此額度。
如需壓縮檔體積請參見 如何將映像或視頻壓縮到滿足要求的大小 。
- 以公網URL傳入時:Qwen3.8系列、Qwen3.7系列、Qwen3.6系列、Qwen3.5系列、Qwen3-VL系列單個映像不超過
-
圖片數量限制:多圖輸入時根據傳入方式不同,支援的圖片數量上限有所區別:
-
以公網URL或本地路徑傳入時:
- Qwen3.8-Max、Qwen3.7-Plus:最多 2048 張
- Qwen3.7-Flash、Qwen3.6-Plus、Qwen3.6-Flash、Qwen3.5-Plus、Qwen3.5-Flash、Qwen3-VL、Qwen-VL、QVQ系列:最多 256 張
- 以 Base 64 編碼傳入時:最多 250 張
-
以公網URL或本地路徑傳入時:
同時受模型圖文總 Token 上限(即最大輸入)的限制,所有圖片的總 Token 數必須小於模型的最大輸入。
檔案傳入方式
-
公網URL:提供一個公網可訪問的檔案地址,支援HTTP或HTTPS協議。為獲得最佳穩定性和效能,可將檔案上傳至OSS,擷取公網 URL。百鍊服務無法訪問 OSS 內網地址(endpoint 中帶
-internal,如https://<bucket>.oss-cn-hangzhou-internal.aliyuncs.com/image.jpg),傳入內網地址會導致檔案下載失敗,返回InvalidParameter,message 為Failed to download multimodal content。請改用 OSS 公網網域名稱(如https://<bucket>.oss-cn-hangzhou.aliyuncs.com/image.jpg)或 OSS 臨時簽名 URL 傳入檔案。 - Base64編碼傳入:將檔案轉換為 Base 64 編碼字串再傳入。
- 本地檔案路徑傳入(僅限 DashScope SDK):傳入本地檔案的路徑。
關於檔案傳入方式的建議,請參見 如何選擇檔案上傳方式?
計算映像與視頻的Token
計算映像與視頻的Token
- 映像
- 視頻
映像 Token = h_bar * w_bar / token_pixels + 2-
h_bar、w_bar:縮放後的映像長寬,模型在處理映像前會進行預先處理,會將映像縮小至特定像素上限內,像素上限與max_pixels和vl_high_resolution_images參數的取值有關。 -
token_pixels:每視覺Token對應的像素值,不同模型情況不同:qwen3.7系列、qwen3.6系列、qwen3.5系列、Qwen3-VL、qwen-vl-max、qwen-vl-plus:每個Token對應32x32像素QVQ及其他Qwen2.5-VL模型:每個Token對應28x28像素
點此查看映像 token 估算樣本
點此查看映像 token 估算樣本
模型調優前必讀
-
文本產生模型調優雖然能在特定業務/情境取得非常好的效果,但有以下限制:
- 耗時較長,包括:擁有一個大規模(最少 0.5億 token)CPT 資料集、構建一個有效(1000+)SFT 資料集、收集足夠的(100+)Bad Case 構建有效 DPO 資料集、模型最佳化迭代速度慢等。
- 費用較高,調優後的模型部署後才能使用,模型部署計費較高。
-
阿里雲百鍊推薦您在考慮使用文本產生模型調優前先嘗試使用的 Prompt 工程(Prompt Engineering)或外掛程式調用(Function Calling)定製化您的應用,模型調優也通常作為改進模型表現“最後的手段”。因為:
- 在許多任務中,模型最初可能表現不佳,但通過應用正確的 Prompt 技巧可以改進結果,不一定需要使用模型調優。
- 迭代最佳化 Prompt、外掛程式,比模型調優的迭代更敏捷、成本更低,因為模型調優的迭代可能需要重新收集資料、清洗最佳化資料、收集 bad case、發起客戶調研等。
- 即使最後一定要進行模型調優,最初的 Prompt 工程、外掛程式迭代最佳化相關工作也不會浪費。您的這些前期工作可以充分地在構建調優資料集時複用(用於構建資料集的輸入)。
快速開始
使用控制台進行模型調優
調優步驟 | 控制台截圖 |
|---|---|
步驟一:在模型調優頁面點擊创建训练任务。 | ![]() |
步驟二:訓練配置
這個組合訓練時間短,資料要求低。 | |
步驟三:資料配置
| ![]() |
步驟四:配置模型參數快照(Checkpoint)儲存參數
在百鍊平台上,模型調優完成後可以匯出參數快照,匯出後才能基於此版本的參數快照在百鍊上進行模型部署。 匯出的參數快照儲存在雲端儲存中,暫不支援訪問或下載。 | ![]() |
步驟五:點擊“開始訓練”後,等待模型訓練完畢。 | |
步驟六:使用阿里雲百鍊的模型部署功能部署訓練好的自訂模型,部署好後就可以對調優好的模型進行評測。模型部署相關資訊請參見模型部署。 | |
典型的調優流程
百鍊提供的三種調優方式並不互斥,而是遞進的、相輔相成的。
CPT(可選)→ SFT → DPO(可選)
-
CPT (持續預訓練)- 補知識 (通用模型知識的“廣度”和“淺度”,無法滿足專業領域的“深度”和“精度”要求)
- 金融模型:
學金融術語 - 醫學模型:
記藥品病理 - 法律模型:
懂法條判例
- 金融模型:
-
SFT (監督微調)- 學做事
- 客服機器人:
學客服流程 - 代碼助手:
學編程範式 - 工具調用 (Agent):
學使用 MCP
- 客服機器人:
-
DPO (直接偏好最佳化)- 做得更好
- 安全與責任感:
拒有害建議 - 簡潔與有效性:
答乾脆利落 - 客觀與中立:
評公正客觀
- 安全與責任感:
調優資料格式
SFT/DPO/CPT 各訓練方式的資料格式規格、打包規則、大小與數量限制、API 上傳配額詳見調優資料上傳規則。各訓練方式支援的檔案格式概覽:
訓練方式 | 檔案格式 |
|---|---|
SFT 文本產生 | jsonl(ChatML messages 多輪結構) |
SFT 多模態(圖片/視頻) | zip(data.jsonl + 圖片/視頻檔案) |
DPO | jsonl(chosen/rejected 偏好對比) |
CPT | jsonl(純文字 {text}) |
評測集 | xlsx |
資料集構建技巧
資料集的規模要求
對於CPT來說,資料集最少需要五千萬Token優質預訓練資料;對於 SFT 來說,資料集最少需要上千條優質調優資料;對於 DPO 來說,資料集一般需要上百條人類偏好資料。如果資料調優後的模型評測結果不佳,最簡單的改進方法是收集更多資料進行訓練。
如果您缺乏資料,建議構建智能體應用(Agent 1.0),使用知識庫索引來增強模型能力。當然在很多複雜的業務情境,可以綜合採用模型調優和知識庫檢索結合的技術方案。
以客服情境為例,可以藉助模型調優解決客服回答的語氣、表達習慣、自我認知等問題,情境涉及的專業知識可以結合知識庫,動態引入到模型上下文中。
阿里雲百鍊推薦您可以先構建 RAG 應用試運行,在收集到足夠的應用資料後再通過模型調優繼續提升模型表現。
您也可以採用以下策略擴充資料集:
- 讓大模型類比產生特定業務/情境的相關內容,輔助您產生更多用於調優資料。(產生模型建議選取表現優異、規模更大的模型)
- 通過應用情境收集、網路爬蟲、社交媒體和線上論壇、公開資料集、夥伴與行業資源、使用者貢獻等各種方式,人工擷取更多資料。
資料的多樣性與均衡性
模型調優有不同情境,針對具體業務情境時,專業性更重要;而針對問答情境時通用性更重要。您需要根據模型負責的業務模組或使用情境進行資料用例設計。因此訓練效果好壞並不是僅取決於資料量,更需要考慮針對情境的專業性和多樣性。
這裡以智能 AI 對話情境為例,介紹一個專業、多樣的資料集應該包含的各種業務情境:
具體業務 | 多樣化情境/業務 |
|---|---|
電商客服 | 活動推送、售前諮詢、售中引導、售後服務、售後回訪、投訴處理等。 |
金融服務 | 貸款諮詢、投資理財顧問、信用卡服務、銀行賬戶管理等。 |
線上醫學 | 病症諮詢、挂號預約、就診須知、藥品資訊查詢、健康小建議等。 |
AI 秘書 | IT 資訊、行政資訊、HR 資訊、員工福利解答、公司日曆查詢等。 |
旅遊出行助手 | 旅行規劃、出入境指南、旅行保險諮詢、目的地風土人情介紹等。 |
企業法律顧問 | 合約審核、智慧財產權保護、合規性檢查、勞動法律答疑、跨境交易諮詢、個案法律分析等。 |
訓練集與驗證集拆分
當您使用控制台進行模型調優時,支援
- 自動將一個完整訓練資料集拆分,隨機抽取少量資料群組成驗證集。
- 選擇獨立上傳資料集。



