Skip to main content
模型推理

TPM 預留

TPM 預留為指定模型鎖定專屬推理容量,確保業務高峰期不受公用限流影響。本文介紹如何建立、接入和管理 TPM 預留。

功能概述

通過 TPM(Tokens Per Minute)預留,您可以為指定模型鎖定專屬的推理輸送量,預留容量內的調用不受公用資源限流影響。
  • 容量保障:預留的 TPM 容量為您的業務專屬,不與其他使用者共用。
  • 專屬模型 code:建立 TPM 預留後,系統自動產生專屬模型 code,您需要將 API 請求中的 model 參數替換為該 code。
  • 溢出策略:建立時可選超額處理方式——自動溢出至隨用隨付(預設,業務不中斷)或僅使用預留容量(超出返回 429,不產生額外費用)。

方案對比與選型

百鍊為推理調用提供多種容量與計費方案,常見包括隨用隨付、資源套件與節省計劃、TPM 預留、PTU 專屬部署。不同方案在計費單位、容量保障強度、超額處理方式與接入改動上各有側重,本節協助您根據業務訴求選擇合適的方案。

方案

計費單位

容量保障

適用情境

超額處理

代碼改動

隨用隨付

按 token

無(共用公用池)

流量波動大/短期

自動服務,受公用限流

無需改動

資源套件/節省計劃

預付費額度

承諾用量折扣(非專屬容量)

費用最佳化

超出轉按量

無需改動

TPM 預留

按 kTPM 預付費

專屬容量剛性兌付

流量可預估、不能接受限流

可選:自動溢出按量(預設)/僅預留容量返回429

替換 model 參數即可

PTU(模型部署

按 kTPM 預付費

專屬部署執行個體

高吞吐高效能

可選:自動溢出按量(預設)/僅PTU容量返回429

替換 model 參數即可

支援的模型

價格以控制台為準,表格僅供參考。
  • 華北2(北京)
  • 新加坡

模型名稱

預付費-按天

輸入(Per 10,000 TPM)

輸出(Per 1,000 TPM)

千問3.8-Max

$16.63

$4.99

千問3.7-Flash-2026-07-15 聯絡商務經理開通

$0.28

$0.11

千問3.7-Max-2026-05-20

$16.63

$4.99

千問3.7-Plus-2026-05-26

$2.77

$1.11

千問3.6-Flash-2026-04-16

$1.66

$1.00

GLM-5.2

$11.09

$3.88

GLM-5.1

$8.32

$3.33

DeepSeek-v4-Flash

$1.39

$0.28

DeepSeek-v4-Flash-0731

$4.27

$1.28

DeepSeek-v4-Pro

$16.63

$3.33

DeepSeek-v4-Pro-0813

$12.82

$3.85

Kimi-K2.6

$9.01

$3.74

計費與使用說明

  • 部署成功即開始計費,預留容量內的調用不額外收費。
  • 預付費一次性支付,從購買成功起連續生效。詳細費用以百鍊控制台為準。
  • 付費周期「按天」按自然日計算,即從執行個體生效時刻起至次日 00:00:00 止,而非從購買時刻起連續 24 小時。例如,16:00 購買的 1 天預留,當天 00:00 到期(有效時間長度約 8 小時)。建議在一天開始時購買,或開啟到期自動續約以避免服務中斷。
  • 縮容與退訂退費:已使用部分按 1.2 倍係數結算,直接引用公式: 退款 = 降量部分預付費 - (降量部分預付費 × 已用時間長度/購買時間長度 × 1.2)
  • 溢出策略為「自動溢出」時:超出保障額度自動降級為標準隨用隨付,服務不中斷,可在詳情頁超額降級統計查看降級次數;為「僅使用預留容量」時:超出返回 429,不產生額外費用。
  • 服務到期後 2 小時內:執行個體仍為運行中,可繼續調用,可續約;到期後 2~14 小時:執行個體已停止,不可調用,仍可續約;到期 14 小時後:執行個體已刪除,不可恢複。
部分模型支援長輸入階梯係數和緩衝折扣,容量計算機會自動應用這些參數。具體如下:

模型

輸入長度上限

緩衝折扣

長輸入階梯係數

Qwen3.8-max

1 Million

0.125

無階梯(1.0)

Qwen3.6-flash-2026-04-16

256K

不支援緩衝

無階梯(1.0)

其他 Qwen 系列

256K

0.2(快取命中部分按 20% 折算容量)

無階梯(1.0)

glm-5.2

1 Million

0.25(快取命中部分按 25% 折算容量)

無階梯(1.0)

glm-5.1

200K

0.2(快取命中部分按 20% 折算容量)

[0, 32K):輸入 1.0 / 輸出 1.0
[32K, 200K]:輸入 1.33 / 輸出 1.17

DeepSeek-v4-Pro-0813

1 Million

0.1(快取命中部分按 10% 折算容量)

無階梯(1.0)

DeepSeek-v4-Pro

256K

0.08(快取命中部分按 8% 折算容量)

無階梯(1.0)

DeepSeek-v4-Flash-0731

1 Million

0.1(快取命中部分按 10% 折算容量)

無階梯(1.0)

DeepSeek-v4-Flash

256K

0.2(快取命中部分按 20% 折算容量)

無階梯(1.0)

Kimi-K2.6

256K

0.2(快取命中部分按 20% 折算容量)

無階梯(1.0)

建立 TPM 預留

前提條件:已開通百鍊模型服務,已建立業務空間。登入百鍊控制台,單擊建立 TPM 預留
image
建立 TPM 預留需一次性支付預付費用。建議先使用 TPM 容量計算機估算所需 TPM,確認費用後再提交。
  1. 填寫以下參數:

    參數

    說明

    必填

    取值說明

    預留名稱

    自訂名稱,便於識別。

    ≤ 50 個字元

    選擇模型

    選擇需要預留容量的模型。提交後自動產生專屬模型 code。

    僅支援已開放 TPM 預留的模型,以控制台展示為準。

    付費周期

    計費周期。

    按天

    輸入TPM

    預留的輸入輸送量,單位 kTPM(1 kTPM = 1,000 Tokens/分鐘)。

    起步和步長因模型而異,以控制台展示為準。

    輸出TPM

    預留的輸出輸送量,單位 kTPM。

    起步和步長因模型而異,以控制台展示為準。

    購買時間長度

    預留的有效時間長度。

    在輸入框中輸入天數,支援 1~30、60、90、120、365 天。

    到期自動續約

    到期前一天 08:00 自動扣款續約。預設開啟。

    開啟 / 關閉

    單次續約時間長度

    每次自動續約的時間長度。

    在輸入框中輸入天數,取值範圍與購買時間長度一致。

    溢出策略

    預留容量耗盡時,超出部分請求的處理方式。

    自動溢出至按 token 付費(預設,超出轉按量、業務不中斷)/ 僅使用預留容量(超出返回 429、不產生額外費用)

  2. 確認參數後單擊立即購買,在費用確認彈窗中核對費用,單擊確認支付
  3. 在 TPM 預留詳情頁的概覽 Tab,找到專屬模型 code,單擊複製。
  4. 將 API 請求中的 model 參數替換為複製的專屬模型 code:
    前提條件:已建立 TPM 預留執行個體且狀態為運行中
    GLM-5.2 的 thinking_budget參數(限制思考長度)在調用時不生效。
# 短時間內請求量快速拉升時,系統需要短暫預熱以匹配所需算力
# 預熱期間部分請求可能出現延遲波動,預熱完成後恢複穩定。
# 請做好請求排隊或重試機制。

import dashscope

response = dashscope.Generation.call(
    api_key="your-api-key",
    model="your-dedicated-model-code",   # 替換為專屬模型 code
    messages=[{"role": "user", "content": "你好"}],
)
print(response.output.text)
# 短時間內請求量快速拉升時,系統需要短暫預熱以匹配所需算力
# 預熱期間部分請求可能出現延遲波動,預熱完成後恢複穩定。
# 請做好請求排隊或重試機制。
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"your-dedicated-model-code","messages":[{"role":"user","content":"你好"}]}'

TPM 容量計算機

建立頁面右側提供 TPM 容量計算機,協助您根據業務負載估算需要購買的 TPM 額度。填寫以下參數後,計算機自動輸出推薦的輸入 TPM 和輸出 TPM。

參數

說明

對結果的影響

每分鐘請求數(RPM)

業務高峰期每分鐘發送的請求數。

RPM 越大,建議購買的輸入和輸出 TPM 同比增大。

平均輸入長度(token)

每條請求的平均輸入 token 數。

輸入越長,所處階梯越高,係數越大,建議購買的輸入 TPM 越高。不同模型的階梯邊界不同,以控制台實際展示為準。

平均輸出長度(token)

每條請求的平均輸出 token 數。

輸出越長,係數可能越大,建議購買的輸出 TPM 越高。

快取命中率

請求中重複首碼被快取命中的比例。實際命中率取決於請求內容的重複程度,以運行結果為準。

命中率越高,輸入容量消耗越慢,建議購買的輸入 TPM 越低。僅影響輸入 TPM,不影響輸出 TPM。

image

查看與管理

前往百鍊控制台,在預留列表頁。列表以模型卡片形式展示所有預留執行個體,支援按模型、時間、狀態篩選。
image

預留詳情

單擊目標模型卡片進入詳情頁,包含以下 3 個 Tab:
  • 概覽
  • 監控
  • API 接入
image
  • 基本資料:預留名稱、專屬模型 code(可複製)、基本模型、輸入/輸出容量。
  • 統計卡片(近 7 天):生效預留數、TPM 總量與峰值用量、平均利用率。
  • 使用率趨勢:可切換輸入/輸出方向,展示預留容量線和實際用量。
  • 超額降級統計:展示超出預留容量後被降級處理的次數(僅「自動溢出」策略下產生降級)。

管理操作

在詳情頁概覽 Tab 的預留列表中,找到目標執行個體,通過操作列執行以下操作:
  • 擴縮容
  • 續約
  • 退訂
image
單擊擴縮容,在彈窗中調整輸入 TPM 和輸出 TPM。
輸入 TPM 和輸出 TPM 支援調整為 0:歸 0 後不再產生容量費用,且專屬模型 code 繼續保留,避免因到期或退訂導致 code 失效。但歸 0 屬於減配,已使用部分按 1.5 倍係數結算違約金(詳見上方計費與使用說明)。
服務到期後 2 小時內為運行中,2~14 小時轉為已停止,14 小時後轉為已到期並最終刪除。

狀態

說明

運行中

正常運行,可使用專屬模型 code 調用。

待生效

已建立,等待生效。

變更配置中

正在執行擴縮容,期間服務不中斷。

已停止

因欠費等原因停止,續約後可恢複。

已到期

到期且未續約,資源已釋放。

已取消

退訂完成,不可恢複。

常見問題

取決於建立時選擇的溢出策略:「自動溢出」策略下,超出預留容量的請求自動降級為隨用隨付,服務不中斷,可在詳情頁概覽 Tab 的超額降級統計查看降級次數和時間,頻繁降級時建議擴容;「僅使用預留容量」策略下,超出請求返回 429 錯誤,不產生額外費用,頻繁 429 時建議擴容。
建立 TPM 預留後,系統自動產生專屬模型 code。在 TPM 預留詳情頁的概覽 Tab 可複製該 code。必須將 API 請求中的 model 參數替換為此 code 才能使用預留容量。
預留到期後,專屬模型 code 失效,後續請求自動回退到公用資源處理(隨用隨付)。建議提前開啟到期自動續約避免服務影響。
在詳情頁概覽 Tab 查看 TPM 用量趨勢圖和超額降級統計。如果利用率持續接近 100% 或頻繁出現降級,建議擴容輸入/輸出 TPM。
「按天」按自然日計算,有效期間為執行個體生效時刻至次日 00:00:00,而非從購買時刻起連續 24 小時。例如,16:00 購買,當天 00:00 到期,有效時間長度約 8 小時。如需完整一天的容量,建議在一天開始時購買,或開啟到期自動續約以連續保障服務。
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援