Skip to main content
用量統計與效能監控

模型監控

模型監控功能可用於:

  • 查看調用記錄
  • 指標監控與警示,如Token延時、調用時間長度、RPM(每分鐘請求數)、TPM(每分鐘Token數)和失敗率
  • 統計Token消耗

支援的模型

  • 監控:普通監控支援選擇模型中的所有模型;進階監控支援北京、新加坡、維吉尼亞地區下的所有模型
  • 警示功能:支援北京、新加坡、維吉尼亞地區下的所有模型。

監控模型運行

系統會自動採集主帳號下所有業務空間內的模型調用資料。當有直接或間接模型調用發生時,系統會自動收集並同步相關資料至目標業務空間的模型監控列表中。
列表記錄按“模型 + 業務空間”維度產生。新模型在首次資料同步完成後自動加入列表(普通監控的延遲通常為小時級,請耐心等待;如需分鐘級的資料洞察,請使用進階監控)。
列表頂部「監控資料」以卡片形式匯總模型總量總調用次數總失敗次數平均調用時間長度平均首包時間長度 「模型監控」表格列出各模型的模型Code業務空間調用總量調用失敗量失敗率平均調用時間長度平均首Token延時(除模型Code、業務空間外均可排序),操作列提供监控日志入口。列表工具列還提供日誌迴流入口,可將推理日誌迴流為訓練資料集。
預設業務空間成員可查看所有業務空間的模型調用情況;子業務空間成員僅能查看當前空間的資料,無法切換查看其他業務空間資料。
在列表中找到目標模型後,點擊其右側操作列的监控,可查詢以下4類監控指標:
  • 安全:識別對話中的違規內容,例如Alibaba Content Security Service錯誤次數
  • 成本:評估模型的成本效益,例如平均單次請求調用量
  • 效能:觀察模型的效能變化,例如調用時間長度首Token延時
  • 錯誤:判斷模型的穩定性,例如失敗次數失敗率
您可基於上述指標建立警示,以便及時發現和處理異常。 點擊操作列「監控」進入模型詳情頁,詳情頁含監控日誌兩個頁簽。監控頁簽下分為調用統計效能指標兩類。 此頁簽可查看安全、成本、錯誤相關指標(如調用次數、失敗次數等)。支援按API-KEY、推理類型、時間範圍以及時間精度(按分鐘/按小時)進行篩選。 調用統計頁簽的失敗次數圖表支援點擊失敗詳情查看失敗明細,便於定位調用失敗原因。 效能指標 此頁簽可查看RPM、TPM、調用時間長度、首Token延時以及非首Token延時等效能相關指標。

查看 Token 消耗

在實際使用中,調整模型的參數、系統提示詞等操作均會改變模型的Token消耗。為統計和精細化管理成本,模型監控提供成本監控相關功能:
  • 匯總:按業務空間維度匯總模型的歷史Token消耗,並可按時間範圍和API Key進一步篩選。
  • 追蹤:記錄每一次模型調用的Token消耗。
  • 警示:設定Token消耗閾值,當指定模型出現異常消耗時,系統立即警示。

查看模型歷史 Token 消耗

  • 查看最近30天的Token消耗:
    1. 當模型出現在目標業務空間的模型監控列表中後,點擊其右側操作列的监控
    2. 在調用統計頁簽的調用量地區,可以查看Token消耗資料。
  • 查看更早的用量:在費用與成本頁面查詢。

查看某次調用的 Token 消耗

該功能目前適用於华北2(北京)、新加坡地區的部分模型。
資料說明:推理日誌(進階監控)從調用發生到可查詢存在分鐘級延遲,請耐心等待;普通監控的用量匯總(如調用次數、Token 總量)延遲為小時級,高峰期可能達 1-2 小時。如遇無資料或查不到記錄的情況,請先確認已等待足夠的資料同步時間。僅記錄開啟推理日誌後的調用資料,開通前的歷史調用無法追溯。
  1. 使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(北京)模型監控(新加坡)頁面,點擊右上方的模型监控配置,按照指引依次開通審計日誌和推理日誌。
    開通後,系統即開始記錄該業務空間內每一次模型調用的輸入與輸出。從調用發生到日誌被記錄存在分鐘級延遲,請耐心等待。
  2. 在模型監控列表中找到目標模型,點擊其右側操作列的日志
  3. 日志頁簽以表格形式展示該模型的即時推理調用記錄,表格包含Request ID/調用時間調用時間長度狀態代碼(支援篩選)、錯誤碼用量請求和響應操作等列。其中用量欄位即為本次調用的Token消耗。

建立異常消耗警示

查看歷史對話(模型日誌)

該功能目前適用於华北2(北京)、新加坡地區的部分模型。
模型監控支援查看模型的每一次對話,包括輸入、輸出及耗時,是故障排查和內容審計的關鍵工具。
資料說明:日誌從調用發生到可查詢存在分鐘級延遲,請耐心等待。如遇即時更新延遲或查不到記錄的情況,請先確認已等待足夠時間(普通監控用量匯總為小時級延遲,進階監控/推理日誌為分鐘級)。僅記錄開啟推理日誌後的調用資料,開通前的歷史調用無法追溯。

步驟一:開通日誌

使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(北京)模型監控(新加坡)頁面,點擊右上方的模型监控配置,按照指引依次開通審計日誌和推理日誌。
開通後,系統即開始記錄該業務空間內每一次模型調用的輸入與輸出。從調用發生到日誌被記錄存在分鐘級延遲,請耐心等待。
如需停止記錄,只需在模型監控配置中關閉推理日誌即可。
推理日誌僅記錄 HTTP API 呼叫的輸入與輸出。WebSocket 即時調用(如 qwen-audio 即時語音模型)產生的轉寫文本(partial/final)和語音回複音頻僅在會話中傳輸給用戶端,不寫入推理日誌。審計日誌會記錄此類調用的模型名、狀態代碼、時間長度和 Token 用量,但不包含轉寫文本和音頻內容。

步驟二:查看歷史對話

  1. 在模型監控列表中找到目標模型,點擊其右側操作列的日志
  2. 日志頁簽以表格形式展示該模型的即時推理調用記錄,表格包含Request ID/調用時間調用時間長度狀態代碼(支援篩選)、錯誤碼用量請求和響應操作等列。其中请求和响应欄位分別對應本次調用的輸入與輸出。
  • 千問Max
    • qwen3-max、qwen3-max-preview、qwen3-max-2025-09-23及之後的快照版本
    • qwen-max
  • 千問Plus
    • qwen3.7-plus、qwen3.7-plus-2026-05-26及之後的快照版本
    • qwen3.6-plus、qwen3.6-plus-2026-04-02及之後的快照版本
    • qwen3.5-plus、qwen3.5-plus-2026-02-15及之後的快照版本
    • qwen-plus、qwen-plus-latest、qwen-plus-2025-12-01及之後的快照版本
  • 千問Flash
    • qwen3.5-flash、qwen3.5-flash-2026-02-23
    • qwen-flash、qwen-flash-2025-07-28
  • 千問Turbo:qwen-turbo
  • 千問Coder:qwen3-coder-flash、qwen3-coder-flash-2025-07-28、qwen3-coder-plus、qwen3-coder-plus-2025-07-22、qwen3-coder-plus-2025-09-23
  • 開源模型:qwen3-235b-a22b、qwen3-235b-a22b-instruct-2507、qwen3-235b-a22b-thinking-2507、qwen3-30b-a3b、qwen3-30b-a3b-instruct-2507、qwen3-30b-a3b-thinking-2507、qwen3-next-80b-a3b-instruct、qwen3-next-80b-a3b-thinking、qwen3-coder-480b-a35b-instruct
  • 三方模型:deepseek-v3.1、deepseek-v3.2、deepseek-v3.2-exp
並非所有模型都支援推理日誌(請求/響應內容記錄)。是否支援由模型本身決定,與模型是否為多模態無關。當所選模型不支援時,介面會顯示當前模型暫不支援日誌 請注意:請求和響應內容僅在開啟推理日誌後才會被採集,開通前的歷史調用不會補錄。若某次調用的輸出內容缺失或存在日誌缺失,請先確認該模型是否支援推理日誌,以及推理日誌是否已在調用發生前完成開通。

建立主動警示

該功能目前適用於新加坡、北京和維吉尼亞地區。
模型的靜默失敗(如逾時、Token消耗突增),傳統應用日誌難以發現。模型監控支援對監控指標(如成本、失敗率、響應延遲)設定警示。一旦指標出現異常,系統立即警示。 模型警示頁麵包含警示規則警示歷史兩個頁簽。警示歷史頁簽可按警示時間、警示規則、警示等級、狀態篩選查看歷史警示記錄,點擊詳情可查看警示詳情。

步驟一:開啟進階監控

  1. 使用主帳號(或擁有足夠許可權的子帳號)登入,在目標業務空間的模型監控(新加坡維吉尼亞北京)頁面,點擊右上方的模型监控配置
  2. 在進階監控地區,手動開啟性能和用量指标监控

步驟二:建立警示規則

  1. 在模型警示(新加坡維吉尼亞北京)頁面,點擊右上方的创建告警规则
  2. 在對話方塊中,選擇要監控的模型和監控模板,確認無誤後點擊确定。當指定的監控指標(如調用統計或效能指標)出現異常時,系統將通知您的團隊。
    • 通知方式:支援簡訊、電子郵件、電話、DingTalk群機器人、企業微信機器人及Webhook。
    • 警示等級:分為普通警告错误紧急,不支援自訂新增或修改。各等級與通知渠道的對應關係如下:
      • 緊急(CRITICAL): 電話、簡訊、郵件
      • 錯誤(ERROR): 簡訊、郵件
      • 警告(WARNING): 簡訊、郵件
      • 普通(INFO): 郵件

接入 Grafana 與自建應用

模型監控的監控指標資料存放區在您的私人Prometheus執行個體中,並支援標準的Prometheus HTTP API,可用於接入 Grafana 或您的自建應用進行可視化分析。

步驟一:擷取資料來源HTTP API地址

  1. 確保已開啟進階監控
  2. 模型監控(新加坡)模型監控(維吉尼亞)模型監控(北京)頁面,點擊右上方的模型监控配置。點擊CloudMonitorPrometheus執行個體右側的查看详情
  3. 设置頁面,根據您的用戶端網路環境(公網或VPC訪問),複製對應的 HTTP API 地址。
    1

步驟二:接入 Grafana 或自建應用

  • 接入自建應用
  • 接入 Grafana
通過Prometheus HTTP API擷取監控資料的樣本如下。完整 API 用法,請參考Prometheus HTTP API文檔
  • 樣本1:查詢阿里雲帳號下全部業務空間在指定時間範圍內(2025年11月20日全天,UTC時間)所有模型的Token消耗(query=model_usage),步長step=60s
    樣本參數說明
    GET {HTTP API}/api/v1/query_range?query=model_usage&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s
    
    Accept: application/json
    Content-Type: application/json
    Authorization: Basic base64Encode(AccessKey:AccessKeySecret)
    
    • query:query對應的值可替換為下方監控指標列表中的任意指標名稱。

      類型

      指標名稱

      描述

      調用次數

      model_call_count

      模型調用次數總和

      調用時間長度

      model_call_duration_total

      模型調用時間長度總和

      model_call_duration

      模型調用時間長度均值

      model_call_duration_p50

      模型調用時間長度p50

      model_call_duration_p99

      模型調用時間長度p99

      model_first_token_duration_total

      模型首包時間長度總和

      model_first_token_duration

      模型首包時間長度均值

      model_first_token_duration_p50

      模型首包時間長度p50

      model_first_token_duration_p99

      模型首包時間長度p99

      非首包時間長度

      model_generation_duration_per_token_total

      模型非首包時間長度總和

      model_generation_duration_per_token

      模型非首包時間長度均值

      model_generation_duration_per_token_p50

      模型非首包時間長度p50

      model_generation_duration_per_token_p99

      模型非首包時間長度p99

      TPS

      model_tps_per_request

      單次請求輸出 Token 速度(TPS),每秒產生 Token 數,衡量模型產生速度(僅進階監控支援)

      用量

      model_usage

      模型用量總和

      關於 TPS 指標:model_tps_per_request 僅在高级监控中展示,進階監控為收費功能。TPS(每秒產生 Token 數)與非首包時間長度(每 Token 的平均產生耗時)呈倒數關係(TPS ≈ 1 ÷ 非首包時間長度均值)。排查響應慢的問題時,建議結合首 Token 延時(TTFT)、非首 Token 延時及輸入 Token 量綜合分析,單次調用總耗時還受輸入長度、網路等因素影響,不能僅憑 TPS 判斷。TPS 觸發的是按請求維度限流,區別於 TPM(每分鐘 Token 數)的按帳號維度限流。
    • HTTP API:{HTTP API}需替換為前面步驟一擷取的HTTP API地址。
    • Authorization:需將阿里雲帳號的 AccessKey:AccessKeySecret 拼接後進行Base64編碼,並以 Basic 編碼後字串 的形式提供。
      樣本值:Basic TFRBSTV3OWlid0U4XXXXU0xb1dZMFVodmRsNw==
      請注意:AccessKeyAccessKey Secret與前面步驟一的Prometheus執行個體必須歸屬同一阿里雲帳號。
  • 樣本2:樣本1基礎上增加篩選,僅擷取指定模型(model=qwen-plus)在指定業務空間(workspace_id=llm-nymssti2mzww****)內的Token消耗。
    樣本說明
    GET {HTTP API}/api/v1/query_range?query=model_usage{workspace_id="llm-nymssti2mzww****",model="qwen-plus"}&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s
    
    Accept: application/json
    Content-Type: application/json
    Authorization: Basic base64Encode(AccessKey:AccessKeySecret)
    
    • query:通過{} 包裹多個過濾條件,條件之間以英文逗號分隔,例如:{workspace_id="值1",model="值2"}支援的過濾條件(LabelKey)清單如下。
      LabelKey描述
      user_id阿里雲帳號ID。
      RAM使用者為UID。如何擷取
      apikey_idAPI Key ID(非API Key),可在密钥管理新加坡| 美國 | 北京)頁面擷取。
      56
      apikey_id 值為 -1 表示調用源自阿里雲百鍊控制台,而非通過API。
      workspace_id業務空間ID。如何擷取
      model模型。
      protocol協議類型。可能取值:
      • HTTP:HTTP非流式
      • SSE:HTTP流式
      • WS:Websocket協議
      sub_protocol子協議。可能取值:
      • DEFAULT:同步調用
      • ASYNC:非同步呼叫
        常見於映像產生模型。文本產生映像
      status_codeHTTP狀態代碼。
      model_call_count監控指標支援該LabelKey。
      error_code錯誤碼。
      model_call_count監控指標支援該LabelKey。
      usage_type用量類型。
      model_usage監控指標支援該LabelKey。
      可能取值:
      • total_tokens
      • input_tokens
      • output_tokens
      • cache_tokens
      • image_tokens
      • audio_tokens
      • video_tokens
      • image_count
      • audio_count
      • video_count
      • duration
      • characters
      • audio_tts
      • times

監控模式對比

模型監控提供兩種監控模式:普通监控高级监控
普通监控:作為基礎服務提供,隨阿里雲百鍊的開通自動開啟,不支援關閉。
高级监控:需主帳號(或擁有足夠許可權的子帳號)在目標業務空間的模型監控(新加坡)模型監控(維吉尼亞)模型監控(北京)介面手動開啟,支援關閉。僅記錄開啟進階監控後的調用資料。

對比項

普通监控(預設)

高级监控(需手動開啟)

資料延時

小時級

分鐘級

查看調用統計

支援

支援

查看失敗調用(詳情)

不支援

支援

查看效能指標

支援

支援

作用範圍

主帳號下所有業務空間

僅在開啟的業務空間內生效

計費

免費

收費

配額與限制

  • 資料保留周期:普通和進階監控的資料預設均保留30天。開啟推理日誌後,調用資料寫入Log ServiceSLS並保留30天,可在SLS控制台調整保留時間。關閉推理日誌後,日誌不再同步到SLS。如需查詢更早的用量資訊,請通過費用與成本頁面查詢。
  • 警示模板限制:每個業務空間最多可建立100個警示模板。
  • API限制:模型監控的監控指標資料請通過Prometheus HTTP API查詢。
    • 替代方案:如需通過API擷取單次調用Token消耗,可在每次調用模型時從響應中的usage欄位提取當前調用資料。該欄位結構樣本如下(更多說明請參見千問API參考):
{
  "prompt_tokens": 3019,
  "completion_tokens": 104,
  "total_tokens": 3123,
  "prompt_tokens_details": {
    "cached_tokens": 2048
  }
}
  • API Key 用量限額:當前不支援為單個 API Key 設定月度或每日 Token 消耗上限並自動停服(即不支援硬性阻斷,無法實現額度用盡後自動禁用 API 呼叫)。如需防止意外欠費,可採用以下替代方案:
    • 警示通知 + 手動禁用 Key:開啟高级监控(收費功能)後,可對 Token 消耗配置警示閾值,當消耗超出閾值時接收消費預警通知,再人工介入處理(如手動禁用對應 API Key)。普通監控僅支援基礎用量查看,不支援配置警示。
    • 免費額度用完即停:適用於僅使用免費配額的情境,開啟後免費額度耗盡時自動停止調用。

計費說明

常見問題

為什麼調用了模型,但在模型監控中查不到調用次數和消耗Token數? 按以下步驟排查:
  1. 資料延遲:確認是否已等待足夠的資料同步時間。普通監控延遲為小時級,進階監控為分鐘級。
  2. 業務空間:如果當前處於某個子業務空間,則只能看到該空間內的資料。切換到預設業務空間可查看所有資料。
調用大模型時出現逾時,可能是什麼原因? 常見原因:
  • 輸出內容過長:模型產生內容過多導致整體耗時超過用戶端等待上限。建議改用流式輸出方式,以更快獲得首個Token。
  • 網路問題:檢查用戶端與阿里雲服務之間的網路連接是否穩定。
使用子帳號開通進階監控,應如何配置許可權? 操作步驟:
  1. 為子帳號配置AliyunBailianFullAccess全域管理(阿里雲百鍊)許可權
  2. 為子帳號配置模型監控-操作(或管理員頁面許可權,使其能在模型監控頁面執行寫入類操作。
  3. 為子帳號配置AliyunCloudMonitorFullAccess系統策略
  4. 建立並授予子帳號建立服務關聯角色系統策略。
    1. 登入RAM控制台,在左側導覽列,選擇許可權管理權限原則,然後點擊頁面上的建立權限原則
    2. 點擊指令碼編輯,將以下內容粘貼至策略輸入框後,點擊确定
{
    "Version": "1",
    "Statement": [
        {
            "Action": "ram:CreateServiceLinkedRole",
            "Resource": "*",
            "Effect": "Allow"
        }
    ]
}
  1. 輸入權限原則名稱CreateServiceLinkedRole後,點擊确定
  2. 在左側導覽列,選擇身份管理使用者。從頁面列表中找到待授權的子帳號,然後點擊子帳號操作列的添加权限
  3. 權限原則列表中,選擇剛建立的權限原則(CreateServiceLinkedRole),然後點擊確認新增授權。至此,子帳號擁有了建立服務關聯角色的許可權。
  4. 完成以上所有許可權配置後,返回模型監控(新加坡)模型監控(維吉尼亞)模型監控(北京)頁面,使用子帳號重試開啟高级监控
使用子帳號開通推理日誌,應如何配置許可權? 操作步驟:
  1. 為子帳號配置AliyunBailianFullAccess全域管理(阿里雲百鍊)許可權
  2. 為子帳號配置模型監控-操作(或管理員頁面許可權,使其能在模型監控頁面執行寫入類操作。
  3. 為子帳號配置AliyunLogFullAccess系統策略
  4. 建立並授予子帳號建立服務關聯角色系統策略。
    1. 登入RAM控制台,在左側導覽列,選擇权限管理权限策略,然後點擊頁面上的建立權限原則
    2. 點擊指令碼編輯,將以下內容粘貼至策略輸入框後,點擊确定
{
    "Version": "1",
    "Statement": [
        {
            "Action": "ram:CreateServiceLinkedRole",
            "Resource": "*",
            "Effect": "Allow"
        }
    ]
}
  1. 輸入權限原則名稱CreateServiceLinkedRole後,點擊确定
  2. 在左側導覽列,選擇身份管理使用者。從頁面列表中找到待授權的子帳號,然後點擊子帳號操作列的添加权限
  3. 權限原則列表中,選擇剛建立的權限原則(CreateServiceLinkedRole),然後點擊確認新增授權。至此,子帳號擁有了建立服務關聯角色的許可權。
  4. 完成以上所有許可權配置後,返回模型監控(北京)模型監控(新加坡)頁面,使用子帳號重試開啟推理日志
如何確保調用後的資料被刪除? 百鍊平台在調用完成後不會即時物理刪除資料,資料保留遵循服務合約的最短必要時間原則。推理日誌預設關閉;開啟後,調用資料寫入Log ServiceSLS並保留30天,關閉後不再寫入新資料。如需縮短保留時間,可在SLS控制台修改對應日誌庫的TTL。

附錄

名詞解釋

名詞

解釋

指對模型的所有直接和間接調用,主要涵蓋以下情境:

  • 通過DashScope SDK或OpenAI相容介面的API調用

  • 模型體驗

  • 阿里雲百鍊應用(智能體/工作流程/智能體編排應用,以及涉及到模型調用的節點,如大模型節點、意圖分類節點以及智能體群組節點等)的測試態和發布態

  • Assistant API(下線中)調用

  • 應用調用

批量推理

對於無需即時響應的情境,通過OpenAI相容-Batch(檔案輸入)介面以離線方式進行的大規模資料處理。

Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援