您可通過部署獲得獨立的、資源專享的推理服務,以滿足您對高並發、低延遲等不同效能的業務需求。
計費方式
部署前可以在模型部署控制台查看不同模型的預估每小時費用。
預置吞吐(PTU,Provisioned Throughput Unit) (高吞吐;高效能) | 模型单元 (自訂效能指標;資源隔離) | Token 用量 (調優後隨用隨付/效果驗證) | |||
|---|---|---|---|---|---|
定義 | 通過平台預留資源,保障特定TPM 吞吐能力的模型部署方式;在保障額度內不限速。 | 按使用時間長度與模型單元數量配置算力,資源獨佔的模型部署方式。 | 以每次調用產生的輸入 Token 與輸出 Token 作為用量計量依據的模型部署方式。 | ||
優勢 |
|
| 不使用不計費。 | ||
支援模型 | 部分預置模型 | 部分預置模型與所有調優後模型 | 部分經過 LoRA 調優後的模型 | ||
使用情境 |
|
| 調優後模型效果驗證 | ||
計費圖示 | ![]() | ![]() | ![]() | ||
計費方式 | 按使用時間長度和預置吞吐 隨用隨付、包天 | 按使用時間長度和模型單元數量 隨用隨付、包月 | 按模型 Token 使用量 隨用隨付 | ||
擴縮容方式 | 自助增減輸送量 | 自助增減模型單元數量 | 在控制台提交申請,等待人工審核。 | ||
產品約束 |
| 預付費購買後,若在首月內提前退訂,日單價(≈ 月單價 / 30)將按 1.2 倍計費 |
| ||
計費詳情
- 按使用時間長度計費(預置吞吐)
- 按使用時間長度計費(模型單元)
- 按模型 Token 使用量
費用 = 使用時間長度 × (輸入 TPM 單價 × 輸入 TPM + 輸出 TPM 單價 × 輸出 TPM)後付費按小時計算:使用時間長度單位為小時,單價取下表"持續 1 小時"列;預付費按天計算:使用時間長度單位為天,單價取下表"持續 1 天"列。- 預付費訂單支付後即時生效,有效期間 N 天至第 N 天 23:59 結束。若在 22:00 後下單,到期日將自動順延1天。
- 預付費訂單到期後,將延後2小時停止服務,停止後資源保留14小時後釋放。
- 預付費訂單無法提前終止服務。
- 後付費時,如果賬戶欠費,部署的資源將繼續保留並計費 24 小時,在這 24 小時內服務仍可正常使用。超過 24 小時後系統停止計費,模型部署進入欠費狀態,底層資源將被刪除,但模型部署任務仍會保留。補足欠費後,系統將重新分配資源並恢複使用(恢複後繼續產生費用)。如果您不希望繼續產生費用,可刪除模型部署任務,刪除成功後將不再計費。
- 此時(僅「自動溢出」策略下),調用 API 返回 Header 將包含:
x-dashscope-ptu-overflow:true。 - TPM 統計請前往:模型監控。
- 新加坡
- 華北2(北京)
- 千問
- DeepSeek
- 千問VL
- GLM
模型名稱 | 模型代碼 | 最長輸入Token | 後付費輸入 Per 10K TPM/小時 | 後付費輸出 Per 1K TPM/小時 | 預付費輸入 Per 10K TPM/天 | 預付費輸出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
千問3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
千問3.7-Flash-2026-07-15 聯絡商務經理開通 | qwen3.7-flash-2026-07-15 | 128K | $0.072 | $0.031 | $0.864 | $0.374 |
千問3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
千問3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
千問3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
千問3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
部署方法
您可以在控制台上部署模型,請參考以下操作步驟:
如果提示許可權不足,請參考:部署時提示許可權不足怎麼辦?
| ![]() ![]() |
| |
模型部署成功後將產生費用。 |
部署配置
- 模型單元
配置內容 | 配置詳情 |
|---|---|
服務名稱 | 自訂部署服務的名稱。 |
選擇模型 | 選擇要部署的模型,包括平台預置模型和已調優的模型。 |
模型單元類型 | 選擇部署規格,不同規格對應不同的算力和效能。 |
部署副本數 | 設定初始部署副本數量,影響服務的並發處理能力。 |
部署模版 | 選擇部署模版(如"單機部署"),不同模版對應不同的資源配置方案。僅在模型單元計費模式下可用。 |
配置模型推理模式 | 部分模型在以模型单元方式部署時,可配置推理模式、最長上下文等。
|
最長上下文 | 部分模型的模型单元部署模式支援該設定。最長上下文長度基於模型類型。 |
服務限流 | 部分模型的模型单元部署模式支援該設定,可限制模型調用的 RPM、TPM。 |
部署列表頁
部署成功後,您可以在部署列表頁查看和管理所有部署服務。列表頁包含以下資訊:
- 服務名稱:部署服務的名稱,單擊可查看部署詳情。
- 模型名稱:部署使用的模型。
- 模型Code:模型部署成功後產生的唯一標識,用於 API 呼叫時指定模型。
- 部署狀態/事件狀態:包括待部署、部署中、運行中、部署失敗、下線中、服務暫停、已停止、刪除中、退訂停服/欠費停服、停服恢複中、運行中(變更配置中)、運行中(變更配置失敗)等狀態。
- 計費方式:當前部署服務的計費方式。
- 部署詳情:模型單元類型、副本數等配置資訊。
- 限流詳情:展示當前部署服務的 RPM(每分鐘請求數)、TPM(每分鐘 Token 數)等限流配置。
- 服務時間:展示部署服務的建立時間與到期時間。
- 操作:根據部署狀態和計費方式,可執行更新、監控、擴縮容、續約、下線、刪除、體驗等操作。
部署後調用
模型部署成功後,支援通過 OpenAI 相容、Dashscope及Assistant SDK進行調用。
在調用已部署成功的模型時,model的取值應為模型部署成功後的模型code。請前往模型部署控制台介面擷取模型code。

部署服務擴縮容
- 預置吞吐(按時間長度):點擊扩缩容按鈕,自助、手動調節執行個體數量。具體降費退費規則請參考:降配退款規則說明。
- 模型單元(按時間長度):點擊扩缩容按鈕,自助、手動調節執行個體數量。
部署服務下線
前往模型部署控制台,找到要停止的部署服務,根據計費類型點擊對應操作:
- 模型單元預付費:點擊下线並確認。
- 後付費:點擊删除並確認。

其他動作
除下線外,部署列表頁的操作列還支援以下操作:
- 更新:更新已部署服務的模型版本,支援全部更新或分批更新(金絲雀發布)。
- 刪除:隨用隨付服務可直接刪除,停止計費。
- 續約:預付費服務可續約延長服務時間,支援自動續約。
- 購買容量包:為預置吞吐部署購買容量包。
常見問題
可以上傳和部署自己的模型嗎?
暫不支援上傳和部署自有模型,建議您持續關注阿里雲百鍊最新動向。
此外,阿里雲人工智慧平台 PAI 提供了部署自有模型的功能,您可以參考PAI-LLM大語言模型部署瞭解部署方法。
部署時提示許可權不足怎麼辦?
-
如果顯示“缺少該模組的許可權”,請確保您的帳號在該業務空間的許可權管理頁面中擁有模型部署-操作許可權。
如果無法正常操作,請聯絡您的組織或 IT 管理員添加相關許可權或代為檢查許可權問題。

-
如果部署時報錯“xx業務空間沒有部署xx模型的許可權”,請前往百鍊的業務空間管理頁面,為對應業務空間添加對應模型的部署許可權。
API 呼叫報錯:
Workspace xxx does not have deployment privilege for model xxxx。
如果提示許可權不足,請聯絡您的組織或 IT 管理員添加相關許可權或代為操作。




