將訓練好的文本模型發布為線上 API 服務。
適用範圍
- 適用地區:當前模型部署 API 僅在新加坡地區開放。如您使用其他地區,請通過該地區的百鍊控制台完成模型部署操作。
- 開通帳號許可權:若使用阿里雲子帳號(RAM使用者),需要為子帳號授予模型調用、訓練和部署許可權。
- 配置環境變數:已成功擷取 API Key,並配置到環境變數。
- 閱讀部署文檔:建議先閱讀模型部署概述和使用 API 建立模型部署任務,瞭解模型部署的使用方法和基本步驟。
部署模型
- 新加坡
POST https://dashscope-intl.aliyuncs.com/api/v1/deploymentsWindows CMD 請將$DASHSCOPE_API_KEY替換為%DASHSCOPE_API_KEY%,PowerShell請替換為$env:DASHSCOPE_API_KEY
請求參數要求標頭(Headers)Content-Typestring (必選)固定值:application/jsonAuthorization string (必選)API Key鑒權,格式為Bearer sk-xxxx。請求體(Request Body)model_namestring (必選)待部署的模型名稱,對應我的模型中的模型 ID。也可通過建立訓練任務介面的輸出擷取。plan string (必選)部署方案。可選值:
string (條件必填)部署模板。當 plan 為 mu 時必須填寫。範例:"deploy_spec": "MU1"。可通過擷取可部署模型列表介面返回的 template_id 欄位擷取。capacity integer (條件必填)部署使用的資源單元數量,需為 base_capacity 的整數倍。不同 deploy_spec 的取值約束不同,例如 MU2 必須為 8 的倍數,MU5 可填 1。billing_method string (條件必填)計費方式。當 plan 為 mu 時必須填寫。當前支援 "POST_PAY"(後付費)。enable_thinking boolean (可選)僅 plan 為 mu 時可設定。部分模型支援,可設定為 true 或 false。max_context_length number (可選)僅 plan 為 mu 時可設定。部分模型支援。範例:"max_context_length": 131072。rpm_limit number (可選)僅 plan 為 mu 時可設定。部分模型支援,requests per minute,每分鐘請求數。tpm_limit number (可選)僅 plan 為 mu 時可設定。部分模型支援,token per minute,每分鐘 Token 使用量。ptu_capacity object (可選)僅 plan 為 ptu 時生效。如果不填寫該參數,將預設按照 10,000 input_tpm 和 1,000 output_tpm 進行設定。
ptu_capacity 屬性 input_tpm number部署的模型每分鐘支援的最大輸入 Token 量。output_tpm number部署的模型每分鐘支援的最大輸出 Token 量。thinking_output_tpm number部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。string (可選)模型的控制台顯示名稱。如果不傳該參數,將自動使用 model_name 的值作為部署名稱。suffix string (可選)模型部署後,將產生新的模型名稱,suffix 用於指定新模型名稱的尾碼,最大長度為8個字元且需全域唯一。每個模型在首次部署時,可以不指定尾碼。如果需要對同一模型進行多次部署,則必須設定尾碼以便於區分。 |
選擇按模型單元計費,計費模式為按模型單元的使用時間長度收費,適用於模型調優後的大規模推理業務,資源專屬,效能和成本靈活可調。 執行以下部署命令後,即便您還沒有調用模型,模型部署服務仍將在部署成功後開始計費。建議您先確認服務計費規則,再執行部署命令。 |
部署排障與效能調優
max-num-seqs 參數不可配置
百鍊模型部署在按預置吞吐計費和按模型單元計費兩種計費方式下,吞吐、並發和產生速度均為平台預置,不支援直接調整 vLLM 內部的 max-num-seqs 等推理引擎參數,本介面的請求參數中也不存在該參數。
按模型單元計費方式下,可通過選擇模型單元類型(對應請求參數 deploy_spec)和調整部署副本數(對應請求參數 capacity)間接控制吞吐能力。
部署模板與資源隔離
當前部署模板僅支援單機部署(單機部署-增強型通用推理),不支援多卡執行個體隔離。如需資源隔離,請使用按模型單元計費方式,該方式下算力資源為業務專屬。
限流錯誤處理
當並發請求超出限流閾值時,介面返回 HTTP 429,錯誤碼為 Throttling.RateQuota,錯誤資訊為 Requests rate limit exceeded, please try again later。處理方式:
- 按預置吞吐計費:調整
ptu_capacity中的input_tpm和output_tpm(控制台對應 Input kTPM 和 Output kTPM),或降低請求頻率。該方式下溢出策略可選自動溢出(切換為隨用隨付)或僅使用 PTU 容量(超出容量的請求直接返回429)。 - 按模型單元計費:調整
rpm_limit和tpm_limit,或降低請求頻率。
上下文長度調優
按模型單元計費方式下可通過請求參數 max_context_length 配置最長上下文,取值範圍 1~262144(實際上限取決於所部署模型的能力)。該參數限制單次請求的上下文規模,從而限制單請求的記憶體佔用,可降低 OOM 風險。
處理大量圖片任務時,請結合圖片尺寸和單請求圖片數量設定該參數。
響應參數request_idstring請求的唯一識別碼。output object任務詳情。
屬性 deployed_model string部署模型的唯一標識。用於查詢模型部署狀態和調用模型。model_name string模型標識名。status string部署狀態:
string使用的基準模型。gmt_create string部署任務建立時間。gmt_modified string部署任務更新時間。workspace_id string阿里雲百鍊API Key所屬的業務空間ID。請參見擷取Workspace ID。charge_type string付費模式。post_paid表示後付費。creator string建立人的阿里雲帳號ID。modifier string修改人的阿里雲帳號ID。plan string部署方式。base_capacity number基本模型運行所需的最小資源單元數量。ready_capacity number已就緒並可立即處理請求的資源單元數量。model_unit_spec string模型單元規格。僅 plan 為 mu 時返回。enable_thinking boolean是否開啟思考模式。僅 plan 為 mu 時返回。max_context_length number最大上下文長度限制。僅 plan 為 mu 時返回。rpm_limit number每分鐘請求數。僅 plan 為 mu 時返回。tpm_limit number每分鐘 Token 使用量。僅 plan 為 mu 時返回。ptu_capacity object預置輸送量配置。僅 plan 為 ptu 時返回。
ptu_capacity 屬性 input_tpm number部署的模型每分鐘支援的最大輸入 Token 量。output_tpm number部署的模型每分鐘支援的最大輸出 Token 量。thinking_output_tpm number部分模型支援,部署的模型每分鐘支援的預置思考最大輸出 Token 量。string錯誤碼。調用失敗時返回。message string錯誤詳情描述。調用失敗時返回。 |
重點關註: output.deployed_model(部署模型的唯一標識)、output.status(部署狀態)。 |