介紹如何查看阿里雲百鍊各模型的用量。
如需瞭解免費額度相關內容,請參考新人免費額度文檔。您也可以在免費額度頁面查看和管理免費額度使用方式。
適用範圍
- 適用地區:本文檔僅適用於新加坡地區,僅新加坡地區模型享有免費額度,其他地區模型無免費額度,具體參見選擇地區、服務部署範圍和接入網域名稱。
- 支援的模型:模型列表中的所有模型均支援查看用量。
查看免費額度使用方式
免費額度頁面頂部提供「免費額度使用概覽」,按模型總數、額度充沛、使用超 50%、使用超 80%、無免費額度等維度匯總當前空間下各模型的免費額度消耗情況,並展示「免費額度即將用盡TOP3模型」列表,便於快速定位需要關注的模型。
「全部模型」表格列出各模型的模型 Code、免費額度剩餘量、到期時間、狀態(未開啟/已開啟/不支援開啟)及操作。支援搜尋、排序、篩選尋找特定模型,點擊單條可切換「免費額度用完即停」開關,或查看模型詳情抽屜。
頁面上方提供大量操作入口,可對所選模型批量開啟或批量關閉「免費額度用完即停」,也可一鍵開啟/關閉所有模型;操作前會彈出確認提示,操作完成後展示成功與失敗結果,完成後可退出大量操作。
在控制台查看免費額度使用方式
- 進入免費額度頁面,選擇模型類型頁簽查看各模型的免費額度使用方式。
- 在全部模型表格中,可通過搜尋、排序、篩選等方式尋找特定模型,並可切換免费额度用完即停開關或使用大量操作功能管理免費額度設定。
查看模型用量
在模型用量頁面查看。資料按業務空間維度統計,資料延遲約為 1 小時。
-
進入頁面後,選擇對應的模型類型(如大语言模型)頁簽,再按需選擇時間範圍。頁面將匯總展示所選時間段內,該推理類型下所有已調用過模型的用量。
統計時間範圍:不支援查看30天以前的統計資料。如需查詢更早的用量資訊,請通過頁面查詢。
按推理類型篩選:僅「大語言模型」頁簽支援按推理類型(即時推理 或 批量推理)篩選;若該空間下從未產生過「批量推理」用量資料,推理類型下拉框只會顯示「即時推理」。
時間精度:支援按分鐘、小時、天三種精度查看。時間跨度超過 1 天時分鐘精度不可選,超過 7 天時僅支援按天查看。
按 API-KEY 篩選:可通過 API-KEY 下拉框篩選指定 API Key 調用產生的用量。
-
如需查詢某個具體模型的用量,可在頁面右側搜尋方塊輸入模型名稱(如
qwen-plus)篩選對應資料。可前往模型列表查詢模型名稱。
- 頁面底部「總調用成功次數 Top 10 模型」地區匯總展示調用次數最多的 10 個模型,支援全屏查看和下載資料。
- 點擊單行查看詳情,進入模型用量詳情頁查看該模型更細粒度的調用趨勢。
- 篩選條件較多時可用重設清空,並按需收合/展開篩選區域。
- 「概覽」頁簽以指標卡片匯總關鍵用量;「更多指標」頁簽可切換不同用量維度趨勢圖。
查看費用概覽
在費用概覽頁面,可查看百鍊服務的費用匯總資訊,包括:
- 費用卡片:展示當前賬期的總消費金額、訂閱購買費用和賬單費用,並可跳轉查看明細。
- 賬單趨勢:以圖表或列表形式展示費用趨勢,支援按月或按天統計,可按產品分類、API Key ID、模型篩選。
- 費用警示:可設定費用警示,在費用異常時及時收到通知。
模型用量統計單位說明
在阿里雲百鍊,不同模型的用量統計口徑如下:
類型 | 二級分類 | 統計單位 | 計費說明(模型調用) |
|---|---|---|---|
大語言模型 | 按輸入和輸出對應的 Token 數計費。 | ||
視覺模型 | 張 | 按成功產生的 映像張數計費。 | |
視頻產生 | 秒 | 按成功產生的 視頻秒數 計費。 | |
語音模型 | 秒、字元或 Token | 可能按音頻時間長度(秒)、對應的文本字元數或 Token 數計費,視模型而定。 | |
全模態模型 | Token | 文本部分按 Token 數,其他模態(音頻、映像、視頻)按對應的 Token 數計費。 | |
向量模型 | Token | 按輸入文本的 Token 數計費。 | |
文本向量模型 |
應用於生產環境
管理模型用量建議:
- 控制模型輸出長度: 在調用模型 API 時,合理限制思考長度和設定
max_tokens參數,可限制模型單次產生內容的最大長度(從而控制費用)。 - 根據任務類型選擇模型: 對於分類、摘要等簡單任務,優先選擇成本更低的輕量級模型,而不是始終使用功能強大但價格也較高的模型。
- 監控與警示: 通過模型監控監控用量趨勢,並可配置用量警示,當用量出現異常時及時收到通知。
- 最佳化 Prompt: 簡潔、清晰的 Prompt 不僅能提升模型輸出品質,也能減少不必要的輸入 Token 消耗。
- 使用批量推理: 對於非即時、大批量的處理任務,使用批量推理通常比即時調用更具成本優勢。
名詞解釋
名詞 | 解釋 |
|---|---|
Token | 大模型以 Token 為單位處理輸入和輸出。一個 Token 可能是:
根據經驗,平均1個漢字約對應 1.5-2 個 Token;1 個英文字母約對應 0.25 個 Token;1 個英文單詞約對應 1.3 個 Token:
每個模型都有最大輸入和輸出 Token 數(詳見模型列表),超過限制會導致請求失敗。 |
实时推理 | 指對模型的所有直接和間接調用,主要涵蓋以下情境:
|
批量推理 | 對於無需即時響應的情境,通過OpenAI相容-Batch(檔案輸入)介面以離線方式進行的大規模資料處理。 |