模型監控功能可用於:
- 查看調用記錄
- 指標監控與警示,如Token延時、調用時間長度、RPM(每分鐘請求數)、TPM(每分鐘Token數)和失敗率
- 統計Token消耗
支援的模型
- 監控:普通監控支援選擇模型中的所有模型;進階監控支援北京、新加坡、維吉尼亞地區下的所有模型。
- 警示功能:支援北京、新加坡、維吉尼亞地區下的所有模型。
監控模型運行
系統會自動採集主帳號下所有業務空間內的模型調用資料。當有直接或間接模型調用發生時,系統會自動收集並同步相關資料至目標業務空間的模型監控列表中。
列表記錄按“模型 + 業務空間”維度產生。新模型在首次資料同步完成後自動加入列表(普通監控的延遲通常為小時級,請耐心等待;如需分鐘級的資料洞察,請使用進階監控)。列表頂部「監控資料」以卡片形式匯總模型總量、總調用次數、總失敗次數、平均調用時間長度、平均首包時間長度。 「模型監控」表格列出各模型的模型Code、業務空間、調用總量、調用失敗量、失敗率、平均調用時間長度、平均首Token延時(除模型Code、業務空間外均可排序),操作列提供监控、日志入口。列表工具列還提供日誌迴流入口,可將推理日誌迴流為訓練資料集。
預設業務空間成員可查看所有業務空間的模型調用情況;子業務空間成員僅能查看當前空間的資料,無法切換查看其他業務空間資料。在列表中找到目標模型後,點擊其右側操作列的监控,可查詢以下4類監控指標:
- 安全:識別對話中的違規內容,例如
Alibaba Content Security Service錯誤次數。 - 成本:評估模型的成本效益,例如
平均單次請求調用量。 - 效能:觀察模型的效能變化,例如
調用時間長度、首Token延時。 - 錯誤:判斷模型的穩定性,例如
失敗次數、失敗率。
- 限流錯誤次數:指因429狀態代碼導致的調用失敗。
- Alibaba Content Security Service錯誤次數:指輸入或輸出包含疑似敏感或高風險內容(例如涉黃、涉政和廣告等)被Alibaba Content Security Service服務攔截。
查看 Token 消耗
在實際使用中,調整模型的參數、系統提示詞等操作均會改變模型的Token消耗。為統計和精細化管理成本,模型監控提供成本監控相關功能:
- 匯總:按業務空間維度匯總模型的歷史Token消耗,並可按時間範圍和API Key進一步篩選。
- 追蹤:記錄每一次模型調用的Token消耗。
- 警示:設定Token消耗閾值,當指定模型出現異常消耗時,系統立即警示。
查看模型歷史 Token 消耗
-
查看最近30天的Token消耗:
- 當模型出現在目標業務空間的模型監控列表中後,點擊其右側操作列的监控。
- 在調用統計頁簽的調用量地區,可以查看Token消耗資料。
- 查看更早的用量:在費用與成本頁面查詢。
查看某次調用的 Token 消耗
該功能目前適用於华北2(北京)、新加坡地區的部分模型。
-
使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(北京)或模型監控(新加坡)頁面,點擊右上方的模型监控配置,按照指引依次開通審計日誌和推理日誌。
開通後,系統即開始記錄該業務空間內每一次模型調用的輸入與輸出。從調用發生到日誌被記錄存在分鐘級延遲,請耐心等待。
- 在模型監控列表中找到目標模型,點擊其右側操作列的日志。
- 日志頁簽以表格形式展示該模型的即時推理調用記錄,表格包含Request ID/調用時間、調用時間長度、狀態代碼(支援篩選)、錯誤碼、用量、請求和響應、操作等列。其中用量欄位即為本次調用的Token消耗。
建立異常消耗警示
- 請參見建立主動警示。
查看歷史對話(模型日誌)
模型監控支援查看模型的每一次對話,包括輸入、輸出及耗時,是故障排查和內容審計的關鍵工具。
步驟一:開通日誌
使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(北京)或模型監控(新加坡)頁面,點擊右上方的模型监控配置,按照指引依次開通審計日誌和推理日誌。
開通後,系統即開始記錄該業務空間內每一次模型調用的輸入與輸出。從調用發生到日誌被記錄存在分鐘級延遲,請耐心等待。
如需停止記錄,只需在模型監控配置中關閉推理日誌即可。
步驟二:查看歷史對話
- 在模型監控列表中找到目標模型,點擊其右側操作列的日志。
- 日志頁簽以表格形式展示該模型的即時推理調用記錄,表格包含Request ID/調用時間、調用時間長度、狀態代碼(支援篩選)、錯誤碼、用量、請求和響應、操作等列。其中请求和响应欄位分別對應本次調用的輸入與輸出。
支援要求和響應的模型
支援要求和響應的模型
-
千問Max
- qwen3-max、qwen3-max-preview、qwen3-max-2025-09-23及之後的快照版本
- qwen-max
-
千問Plus
- qwen3.7-plus、qwen3.7-plus-2026-05-26及之後的快照版本
- qwen3.6-plus、qwen3.6-plus-2026-04-02及之後的快照版本
- qwen3.5-plus、qwen3.5-plus-2026-02-15及之後的快照版本
- qwen-plus、qwen-plus-latest、qwen-plus-2025-12-01及之後的快照版本
-
千問Flash
- qwen3.5-flash、qwen3.5-flash-2026-02-23
- qwen-flash、qwen-flash-2025-07-28
- 千問Turbo:qwen-turbo
- 千問Coder:qwen3-coder-flash、qwen3-coder-flash-2025-07-28、qwen3-coder-plus、qwen3-coder-plus-2025-07-22、qwen3-coder-plus-2025-09-23
- 開源模型:qwen3-235b-a22b、qwen3-235b-a22b-instruct-2507、qwen3-235b-a22b-thinking-2507、qwen3-30b-a3b、qwen3-30b-a3b-instruct-2507、qwen3-30b-a3b-thinking-2507、qwen3-next-80b-a3b-instruct、qwen3-next-80b-a3b-thinking、qwen3-coder-480b-a35b-instruct
- 三方模型:deepseek-v3.1、deepseek-v3.2、deepseek-v3.2-exp
建立主動警示
模型的靜默失敗(如逾時、Token消耗突增),傳統應用日誌難以發現。模型監控支援對監控指標(如成本、失敗率、響應延遲)設定警示。一旦指標出現異常,系統立即警示。
模型警示頁麵包含警示規則和警示歷史兩個頁簽。警示歷史頁簽可按警示時間、警示規則、警示等級、狀態篩選查看歷史警示記錄,點擊詳情可查看警示詳情。
步驟一:開啟進階監控
- 使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(新加坡、維吉尼亞或北京)頁面,點擊右上方的模型监控配置。
- 在進階監控地區,手動開啟性能和用量指标监控。
步驟二:建立警示規則
- 在模型警示(新加坡、維吉尼亞或北京)頁面,點擊右上方的创建告警规则。
-
在對話方塊中,選擇要監控的模型和監控模板,確認無誤後點擊确定。當指定的監控指標(如調用統計或效能指標)出現異常時,系統將通知您的團隊。
- 通知方式:支援簡訊、電子郵件、電話、DingTalk群機器人、企業微信機器人及Webhook。
-
警示等級:分為普通、警告、错误和紧急,不支援自訂新增或修改。各等級與通知渠道的對應關係如下:
- 緊急(CRITICAL): 電話、簡訊、郵件
- 錯誤(ERROR): 簡訊、郵件
- 警告(WARNING): 簡訊、郵件
- 普通(INFO): 郵件
接入 Grafana 與自建應用
模型監控的監控指標資料存放區在您的私人Prometheus執行個體中,並支援標準的Prometheus HTTP API,可用於接入 Grafana 或您的自建應用進行可視化分析。
步驟一:擷取資料來源HTTP API地址
- 確保已開啟進階監控。
- 在模型監控(新加坡)、模型監控(維吉尼亞)或模型監控(北京)頁面,點擊右上方的模型监控配置。點擊CloudMonitorPrometheus執行個體右側的查看详情。
-
在设置頁面,根據您的用戶端網路環境(公網或VPC訪問),複製對應的 HTTP API 地址。

步驟二:接入 Grafana 或自建應用
- 接入自建應用
- 接入 Grafana
-
樣本1:查詢阿里雲帳號下全部業務空間在指定時間範圍內(2025年11月20日全天,UTC時間)所有模型的Token消耗(query=
model_usage),步長step=60s。樣本 參數說明 -
query:
query對應的值可替換為下方監控指標列表中的任意指標名稱。關於 TPS 指標:展開查看監控指標
類型
指標名稱
描述
調用次數
model_call_count
模型調用次數總和
調用時間長度
model_call_duration_total
模型調用時間長度總和
model_call_duration
模型調用時間長度均值
model_call_duration_p50
模型調用時間長度p50
model_call_duration_p99
模型調用時間長度p99
model_first_token_duration_total
模型首包時間長度總和
model_first_token_duration
模型首包時間長度均值
model_first_token_duration_p50
模型首包時間長度p50
model_first_token_duration_p99
模型首包時間長度p99
非首包時間長度
model_generation_duration_per_token_total
模型非首包時間長度總和
model_generation_duration_per_token
模型非首包時間長度均值
model_generation_duration_per_token_p50
模型非首包時間長度p50
model_generation_duration_per_token_p99
模型非首包時間長度p99
TPS
model_tps_per_request
單次請求輸出 Token 速度(TPS),每秒產生 Token 數,衡量模型產生速度(僅進階監控支援)
用量
model_usage
模型用量總和
model_tps_per_request僅在高级监控中展示,進階監控為收費功能。TPS(每秒產生 Token 數)與非首包時間長度(每 Token 的平均產生耗時)呈倒數關係(TPS ≈ 1 ÷ 非首包時間長度均值)。排查響應慢的問題時,建議結合首 Token 延時(TTFT)、非首 Token 延時及輸入 Token 量綜合分析,單次調用總耗時還受輸入長度、網路等因素影響,不能僅憑 TPS 判斷。TPS 觸發的是按請求維度限流,區別於 TPM(每分鐘 Token 數)的按帳號維度限流。 -
HTTP API:
{HTTP API}需替換為前面步驟一擷取的HTTP API地址。 -
Authorization:需將阿里雲帳號的
AccessKey:AccessKeySecret拼接後進行Base64編碼,並以Basic 編碼後字串的形式提供。樣本值:Basic TFRBSTV3OWlid0U4XXXXU0xb1dZMFVodmRsNw==
請注意:AccessKey及AccessKey Secret與前面步驟一的Prometheus執行個體必須歸屬同一阿里雲帳號。
-
query:
-
樣本2:在樣本1基礎上增加篩選,僅擷取指定模型(model=
qwen-plus)在指定業務空間(workspace_id=llm-nymssti2mzww****)內的Token消耗。樣本 說明 -
query:通過
{}包裹多個過濾條件,條件之間以英文逗號分隔,例如:{workspace_id="值1",model="值2"}。支援的過濾條件(LabelKey)清單如下。展開查看支援的過濾條件
LabelKey 描述 user_id 阿里雲帳號ID。 RAM使用者為UID。如何擷取
apikey_id API Key ID(非API Key),可在密钥管理(新加坡| 美國 | 北京)頁面擷取。
apikey_id 值為 -1 表示調用源自阿里雲百鍊控制台,而非通過API。workspace_id 業務空間ID。如何擷取 model 模型。 protocol 協議類型。可能取值: - HTTP:HTTP非流式
- SSE:HTTP流式
- WS:Websocket協議
sub_protocol 子協議。可能取值: - DEFAULT:同步調用
-
ASYNC:非同步呼叫
常見於映像產生模型。文本產生映像
status_code HTTP狀態代碼。 僅
model_call_count監控指標支援該LabelKey。error_code 錯誤碼。 僅
model_call_count監控指標支援該LabelKey。usage_type 用量類型。 僅
可能取值:model_usage監控指標支援該LabelKey。- total_tokens
- input_tokens
- output_tokens
- cache_tokens
- image_tokens
- audio_tokens
- video_tokens
- image_count
- audio_count
- video_count
- duration
- characters
- audio_tts
- times
-
query:通過
監控模式對比
模型監控提供兩種監控模式:普通监控和高级监控。
普通监控:作為基礎服務提供,隨阿里雲百鍊的開通自動開啟,不支援關閉。
高级监控:需主帳號(或擁有足夠許可權的子帳號)在目標業務空間的模型監控(新加坡)、模型監控(維吉尼亞)或模型監控(北京)介面手動開啟,支援關閉。僅記錄開啟進階監控後的調用資料。
對比項 | 普通监控(預設) | 高级监控(需手動開啟) | |
|---|---|---|---|
資料延時 | 小時級 | 分鐘級 | |
查看調用統計 | 支援 | 支援 | |
查看失敗調用(詳情) | 不支援 | 支援 | |
查看效能指標 | 支援 | 支援 | |
作用範圍 | 主帳號下所有業務空間 | 僅在開啟的業務空間內生效 | |
計費 | 免費 | 收費 | |
配額與限制
- 資料保留周期:普通和進階監控的資料預設均保留30天。開啟推理日誌後,調用資料寫入Log ServiceSLS並保留30天,可在SLS控制台調整保留時間。關閉推理日誌後,日誌不再同步到SLS。如需查詢更早的用量資訊,請通過費用與成本頁面查詢。
- 警示模板限制:每個業務空間最多可建立100個警示模板。
-
API限制:模型監控的監控指標資料請通過Prometheus HTTP API查詢。
- 替代方案:如需通過API擷取單次調用Token消耗,可在每次調用模型時從響應中的
usage欄位提取當前調用資料。該欄位結構樣本如下(更多說明請參見千問API參考):
- 替代方案:如需通過API擷取單次調用Token消耗,可在每次調用模型時從響應中的
-
API Key 用量限額:當前不支援為單個 API Key 設定月度或每日 Token 消耗上限並自動停服(即不支援硬性阻斷,無法實現額度用盡後自動禁用 API 呼叫)。如需防止意外欠費,可採用以下替代方案:
- 警示通知 + 手動禁用 Key:開啟高级监控(收費功能)後,可對 Token 消耗配置警示閾值,當消耗超出閾值時接收消費預警通知,再人工介入處理(如手動禁用對應 API Key)。普通監控僅支援基礎用量查看,不支援配置警示。
- 免費額度用完即停:適用於僅使用免費配額的情境,開啟後免費額度耗盡時自動停止調用。
計費說明
- 普通監控:免費。
- 進階監控:開啟後,分鐘級的監控資料將寫入CloudMonitorCMS服務併產生費用。具體計費方式參見CloudMonitorCMS計費概述。
- 推理日誌:開啟後,分鐘級的日誌資料將寫入Log ServiceSLS服務併產生費用。具體計費方式參見Log ServiceSLS計費概述。
常見問題
為什麼調用了模型,但在模型監控中查不到調用次數和消耗Token數?
按以下步驟排查:
- 資料延遲:確認是否已等待足夠的資料同步時間。普通監控延遲為小時級,進階監控為分鐘級。
- 業務空間:如果當前處於某個子業務空間,則只能看到該空間內的資料。切換到預設業務空間可查看所有資料。
- 輸出內容過長:模型產生內容過多導致整體耗時超過用戶端等待上限。建議改用流式輸出方式,以更快獲得首個Token。
- 網路問題:檢查用戶端與阿里雲服務之間的網路連接是否穩定。
-
為子帳號配置
AliyunBailianFullAccess全域管理(阿里雲百鍊)許可權。 -
為子帳號配置
模型監控-操作(或管理員)頁面許可權,使其能在模型監控頁面執行寫入類操作。 - 為子帳號配置AliyunCloudMonitorFullAccess系統策略。
-
建立並授予子帳號建立服務關聯角色系統策略。
- 登入RAM控制台,在左側導覽列,選擇許可權管理權限原則,然後點擊頁面上的建立權限原則。
- 點擊指令碼編輯,將以下內容粘貼至策略輸入框後,點擊确定。
- 輸入權限原則名稱
CreateServiceLinkedRole後,點擊确定。 - 在左側導覽列,選擇身份管理使用者。從頁面列表中找到待授權的子帳號,然後點擊子帳號操作列的添加权限。
- 從權限原則列表中,選擇剛建立的權限原則(CreateServiceLinkedRole),然後點擊確認新增授權。至此,子帳號擁有了建立服務關聯角色的許可權。
- 完成以上所有許可權配置後,返回模型監控(新加坡)、模型監控(維吉尼亞)或模型監控(北京)頁面,使用子帳號重試開啟高级监控。
-
為子帳號配置
AliyunBailianFullAccess全域管理(阿里雲百鍊)許可權。 -
為子帳號配置
模型監控-操作(或管理員)頁面許可權,使其能在模型監控頁面執行寫入類操作。 - 為子帳號配置AliyunLogFullAccess系統策略。
-
建立並授予子帳號建立服務關聯角色系統策略。
- 登入RAM控制台,在左側導覽列,選擇权限管理权限策略,然後點擊頁面上的建立權限原則。
- 點擊指令碼編輯,將以下內容粘貼至策略輸入框後,點擊确定。
- 輸入權限原則名稱
CreateServiceLinkedRole後,點擊确定。 - 在左側導覽列,選擇身份管理使用者。從頁面列表中找到待授權的子帳號,然後點擊子帳號操作列的添加权限。
- 從權限原則列表中,選擇剛建立的權限原則(CreateServiceLinkedRole),然後點擊確認新增授權。至此,子帳號擁有了建立服務關聯角色的許可權。
- 完成以上所有許可權配置後,返回模型監控(北京)或模型監控(新加坡)頁面,使用子帳號重試開啟推理日志。
附錄
名詞解釋
名詞 | 解釋 |
|---|---|
指對模型的所有直接和間接調用,主要涵蓋以下情境:
| |
批量推理 | 對於無需即時響應的情境,通過OpenAI相容-Batch(檔案輸入)介面以離線方式進行的大規模資料處理。 |
表徵圖,選擇AdministrationData sources。點擊+ Add new data source,資料來源類型選擇Prometheus。
表徵圖,在左側導覽列中點擊Dashboards。