Skip to main content
用量統計與效能監控

模型用量

介紹如何查看阿里雲百鍊各模型的用量。

如需瞭解免費額度相關內容,請參考新人免費額度文檔。您也可以在免費額度頁面查看和管理免費額度使用方式。

適用範圍

  • 適用地區:本文檔僅適用於新加坡地區,僅新加坡地區模型享有免費額度,其他地區模型無免費額度,具體參見選擇地區、服務部署範圍和接入網域名稱
  • 支援的模型:模型列表中的所有模型均支援查看用量。

查看免費額度使用方式

免費額度頁面頂部提供「免費額度使用概覽」,按模型總數、額度充沛、使用超 50%、使用超 80%、無免費額度等維度匯總當前空間下各模型的免費額度消耗情況,並展示「免費額度即將用盡TOP3模型」列表,便於快速定位需要關注的模型。 「全部模型」表格列出各模型的模型 Code免費額度剩餘量到期時間狀態(未開啟/已開啟/不支援開啟)及操作。支援搜尋、排序、篩選尋找特定模型,點擊單條可切換「免費額度用完即停」開關,或查看模型詳情抽屜。 頁面上方提供大量操作入口,可對所選模型批量開啟批量關閉「免費額度用完即停」,也可一鍵開啟/關閉所有模型;操作前會彈出確認提示,操作完成後展示成功與失敗結果,完成後可退出大量操作

在控制台查看免費額度使用方式

  1. 進入免費額度頁面,選擇模型類型頁簽查看各模型的免費額度使用方式。
  2. 在全部模型表格中,可通過搜尋、排序、篩選等方式尋找特定模型,並可切換免费额度用完即停開關或使用大量操作功能管理免費額度設定。
免費額度用完即停:僅消耗平台贈送的免費 Token 額度,免費額度用盡時服務將自動停止(返回403錯誤:AllocationQuota.FreeTierOnly),避免產生免費額度以外的費用。若您希望在免費額度用盡後仍繼續使用模型服務,並根據實際產生的用量付費,請保持本功能關閉狀態。您只能在賬戶內仍有未消耗的免費額度時開啟本功能。一旦功能開啟,若您需要關閉本功能,需要在免費額度完全消耗後再進行關閉(免費額度消耗記錄可在賬單中查看,賬單記錄按分鐘匯總產生;控制台免費額度資料分鐘級更新,支援手動重新整理頁面同步,請以控制台顯示的免費額度數值為準。)

查看模型用量

模型用量頁面查看。資料按業務空間維度統計,資料延遲約為 1 小時
  1. 進入頁面後,選擇對應的模型類型(如大语言模型)頁簽,再按需選擇時間範圍。頁面將匯總展示所選時間段內,該推理類型下所有已調用過模型的用量。
    統計時間範圍:不支援查看30天以前的統計資料。如需查詢更早的用量資訊,請通過頁面查詢。
    按推理類型篩選:僅「大語言模型」頁簽支援按推理類型(即時推理批量推理)篩選;若該空間下從未產生過「批量推理」用量資料,推理類型下拉框只會顯示「即時推理」。
    時間精度:支援按分鐘小時三種精度查看。時間跨度超過 1 天時分鐘精度不可選,超過 7 天時僅支援按天查看。
    按 API-KEY 篩選:可通過 API-KEY 下拉框篩選指定 API Key 調用產生的用量。
  2. 如需查詢某個具體模型的用量,可在頁面右側搜尋方塊輸入模型名稱(如qwen-plus)篩選對應資料。
    可前往模型列表查詢模型名稱。
  3. 頁面底部「總調用成功次數 Top 10 模型」地區匯總展示調用次數最多的 10 個模型,支援全屏查看和下載資料。
「調用模型」表格按模型 Code 列出各模型的調用量、Token 用量等用量指標(指標列隨所選模型類型不同而不同)。表格與圖表區域的常用操作:
  • 點擊單行查看詳情,進入模型用量詳情頁查看該模型更細粒度的調用趨勢。
  • 篩選條件較多時可用重設清空,並按需收合/展開篩選區域。
  • 「概覽」頁簽以指標卡片匯總關鍵用量;「更多指標」頁簽可切換不同用量維度趨勢圖。

查看費用概覽

費用概覽頁面,可查看百鍊服務的費用匯總資訊,包括:
  • 費用卡片:展示當前賬期的總消費金額、訂閱購買費用和賬單費用,並可跳轉查看明細。
  • 賬單趨勢:以圖表或列表形式展示費用趨勢,支援按月或按天統計,可按產品分類、API Key ID、模型篩選。
  • 費用警示:可設定費用警示,在費用異常時及時收到通知。

模型用量統計單位說明

在阿里雲百鍊,不同模型的用量統計口徑如下:

類型

二級分類

統計單位

計費說明(模型調用)

大語言模型

按輸入和輸出對應的 Token 數計費。

視覺模型

按成功產生的 映像張數計費。

視頻產生

按成功產生的 視頻秒數 計費。

語音模型

秒、字元或 Token

可能按音頻時間長度(秒)、對應的文本字元數或 Token 數計費,視模型而定。

全模態模型

Token

文本部分按 Token 數,其他模態(音頻、映像、視頻)按對應的 Token 數計費。

向量模型

Token

按輸入文本的 Token 數計費。

文本向量模型

應用於生產環境

管理模型用量建議:
  • 控制模型輸出長度: 在調用模型 API 時,合理限制思考長度和設定 max_tokens 參數,可限制模型單次產生內容的最大長度(從而控制費用)。
  • 根據任務類型選擇模型: 對於分類、摘要等簡單任務,優先選擇成本更低的輕量級模型,而不是始終使用功能強大但價格也較高的模型。
  • 監控與警示: 通過模型監控監控用量趨勢,並可配置用量警示,當用量出現異常時及時收到通知。
  • 最佳化 Prompt: 簡潔、清晰的 Prompt 不僅能提升模型輸出品質,也能減少不必要的輸入 Token 消耗。
  • 使用批量推理: 對於非即時、大批量的處理任務,使用批量推理通常比即時調用更具成本優勢。

名詞解釋

名詞

解釋

Token

大模型以 Token 為單位處理輸入和輸出。一個 Token 可能是:

  • 單個字元:A

  • 完整的單詞:largeModel

  • 長單詞的一部分:一個長單詞通常會被拆分為多個 Token,拆分的過程稱為分詞。

根據經驗,平均1個漢字約對應 1.5-2 個 Token;1 個英文字母約對應 0.25 個 Token;1 個英文單詞約對應 1.3 個 Token:

  • 阿里雲百鍊:約 4-5 個 Token

  • Hello World:約 2 個 Token

每個模型都有最大輸入和輸出 Token 數(詳見模型列表),超過限制會導致請求失敗。

实时推理

指對模型的所有直接和間接調用,主要涵蓋以下情境:

批量推理

對於無需即時響應的情境,通過OpenAI相容-Batch(檔案輸入)介面以離線方式進行的大規模資料處理。

常見問題

Q: 如何查我的阿里雲帳號的 Token 總用量? A: 使用阿里雲帳號(主帳號)訪問賬單詳情頁面並匯出賬單,然後在賬單中查看 Token 用量。
Token Plan
模型體驗
  • 音樂產生
用量統計與效能監控
資產中心
服務支援