Skip to main content
文本產生

文本產生-部署模型

將訓練好的文本模型發布為線上 API 服務。

適用範圍

部署模型

  • 新加坡
POST https://dashscope-intl.aliyuncs.com/api/v1/deployments
Windows CMD 請將$DASHSCOPE_API_KEY替換為%DASHSCOPE_API_KEY%,PowerShell請替換為 $env:DASHSCOPE_API_KEY

請求參數

要求標頭(Headers)
Content-Type string (必選)固定值:application/jsonAuthorization string (必選)API Key鑒權,格式為Bearer sk-xxxx
請求體(Request Body)
model_name string (必選)待部署的模型名稱,對應我的模型中的模型 ID。也可通過建立訓練任務介面的輸出擷取。plan string (必選)部署方案。可選值:
  • mu:按模型單元計費。
  • lora:LoRA 共用部署(按 Token 用量計費)。
  • ptu:按預置輸送量計費。
deploy_spec string (條件必填)部署模板。當 planmu 時必須填寫。範例:"deploy_spec": "MU1"可通過擷取可部署模型列表介面返回的 template_id 欄位擷取。capacity integer (條件必填)部署使用的資源單元數量,需為 base_capacity 的整數倍。不同 deploy_spec 的取值約束不同,例如 MU2 必須為 8 的倍數,MU5 可填 1。billing_method string (條件必填)計費方式。當 planmu 時必須填寫。當前支援 "POST_PAY"(後付費)。enable_thinking boolean (可選)planmu 時可設定。部分模型支援,可設定為 truefalsemax_context_length number (可選)planmu 時可設定。部分模型支援。範例:"max_context_length": 131072rpm_limit number (可選)planmu 時可設定。部分模型支援,requests per minute,每分鐘請求數。tpm_limit number (可選)planmu 時可設定。部分模型支援,token per minute,每分鐘 Token 使用量。ptu_capacity object (可選)planptu 時生效。如果不填寫該參數,將預設按照 10,000 input_tpm1,000 output_tpm 進行設定。

ptu_capacity 屬性

input_tpm number部署的模型每分鐘支援的最大輸入 Token 量。output_tpm number部署的模型每分鐘支援的最大輸出 Token 量。thinking_output_tpm number部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。
name string (可選)模型的控制台顯示名稱。如果不傳該參數,將自動使用 model_name 的值作為部署名稱。suffix string (可選)模型部署後,將產生新的模型名稱,suffix 用於指定新模型名稱的尾碼,最大長度為8個字元且需全域唯一。每個模型在首次部署時,可以不指定尾碼。如果需要對同一模型進行多次部署,則必須設定尾碼以便於區分。
  • 按模型單元計費
  • 按Token用量計費
  • 按預置吞吐計費
選擇按模型單元計費,計費模式為按模型單元的使用時間長度收費,適用於模型調優後的大規模推理業務,資源專屬,效能和成本靈活可調。
執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。
curl "https://dashscope-intl.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_plus",
    "model_name": "qwen-plus-2025-12-01",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "billing_method": "POST_PAY",
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

部署排障與效能調優

max-num-seqs 參數不可配置

百鍊模型部署在按預置吞吐計費按模型單元計費兩種計費方式下,吞吐、並發和產生速度均為平台預置,不支援直接調整 vLLM 內部的 max-num-seqs 等推理引擎參數,本介面的請求參數中也不存在該參數。 按模型單元計費方式下,可通過選擇模型單元類型(對應請求參數 deploy_spec)和調整部署副本數(對應請求參數 capacity)間接控制吞吐能力。

部署模板與資源隔離

當前部署模板僅支援單機部署(單機部署-增強型通用推理),不支援多卡執行個體隔離。如需資源隔離,請使用按模型單元計費方式,該方式下算力資源為業務專屬。

限流錯誤處理

當並發請求超出限流閾值時,介面返回 HTTP 429,錯誤碼為 Throttling.RateQuota,錯誤資訊為 Requests rate limit exceeded, please try again later。處理方式:
  • 按預置吞吐計費:調整 ptu_capacity 中的 input_tpmoutput_tpm(控制台對應 Input kTPMOutput kTPM),或降低請求頻率。該方式下溢出策略可選自動溢出(切換為隨用隨付)或僅使用 PTU 容量(超出容量的請求直接返回 429)。
  • 按模型單元計費:調整 rpm_limittpm_limit,或降低請求頻率。

上下文長度調優

按模型單元計費方式下可通過請求參數 max_context_length 配置最長上下文,取值範圍 1~262144(實際上限取決於所部署模型的能力)。該參數限制單次請求的上下文規模,從而限制單請求的記憶體佔用,可降低 OOM 風險。 處理大量圖片任務時,請結合圖片尺寸和單請求圖片數量設定該參數。

響應參數

request_id string請求的唯一識別碼。output object任務詳情。

屬性

deployed_model string部署模型的唯一標識。用於查詢模型部署狀態和調用模型。model_name string模型標識名。status string部署狀態:
  • PENDING:正在建立部署任務。
  • UPDATING:正在更新部署任務。
  • RUNNING:部署任務正在運行,此時已部署的模型可以正常處理請求。
  • STOPPED:部署任務已經停止,此時的部署任務不會被計費。
  • DELETING:正在刪除部署任務。
  • FAILED:部署任務建立或更新失敗。
base_model string使用的基準模型。gmt_create string部署任務建立時間。gmt_modified string部署任務更新時間。workspace_id string阿里雲百鍊API Key所屬的業務空間ID。請參見擷取Workspace IDcharge_type string付費模式。post_paid表示後付費。creator string建立人的阿里雲帳號ID。modifier string修改人的阿里雲帳號ID。plan string部署方式。base_capacity number基本模型運行所需的最小資源單元數量。ready_capacity number已就緒並可立即處理請求的資源單元數量。model_unit_spec string模型單元規格。僅 planmu 時返回。enable_thinking boolean是否開啟思考模式。僅 planmu 時返回。max_context_length number最大上下文長度限制。僅 planmu 時返回。rpm_limit number每分鐘請求數。僅 planmu 時返回。tpm_limit number每分鐘 Token 使用量。僅 planmu 時返回。ptu_capacity object預置輸送量配置。僅 planptu 時返回。

ptu_capacity 屬性

input_tpm number部署的模型每分鐘支援的最大輸入 Token 量。output_tpm number部署的模型每分鐘支援的最大輸出 Token 量。thinking_output_tpm number部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。
code string錯誤碼。調用失敗時返回。message string錯誤詳情描述。調用失敗時返回。
  • 成功響應樣本
  • 錯誤響應樣本
重點關註:output.deployed_model(部署模型的唯一標識)、output.status(部署狀態)。
{
    "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
    "output": {
        "deployed_model": "qwen-plus-2025-12-01-mu-xxxx",
        "gmt_create": "2025-06-17T11:00:38.68",
        "gmt_modified": "2025-06-17T11:00:38.68",
        "status": "PENDING",
        "model_name": "qwen-plus-2025-12-01",
        "base_model": "qwen-plus",
        "model_unit_spec": "MU1",
        "enable_thinking": true,
        "max_context_length": 10000,
        "rpm_limit": 500,
        "tpm_limit": 1000,
        "base_capacity": 1,
        "ready_capacity": 0,
        "workspace_id": "llm-v71tlv3d***",
        "charge_type": "post_paid",
        "creator": "175805416***",
        "modifier": "175805416***",
        "plan": "mu"
    }
}

下一步

部署為非同步作業,調用本介面後可通過查詢和管理部署介面查詢部署狀態。