介绍如何查看阿里云百炼各模型的用量。
如需了解免费额度相关内容,请参考新人免费额度文档。您也可以在免费额度页面查看和管理免费额度使用情况。
适用范围
- 适用地域:本文档仅适用于新加坡地域,仅新加坡地域模型享有免费额度,其他地域模型无免费额度,具体参见选择地域、服务部署范围和接入域名。
- 支持的模型:模型列表中的所有模型均支持查看用量。
查看免费额度使用情况
免费额度页面顶部提供「免费额度使用概览」,按模型总数、额度充沛、使用超 50%、使用超 80%、无免费额度等维度汇总当前空间下各模型的免费额度消耗情况,并展示「免费额度即将用尽TOP3模型」列表,便于快速定位需要关注的模型。
「全部模型」表格列出各模型的模型 Code、免费额度剩余量、过期时间、状态(未开启/已开启/不支持开启)及操作。支持搜索、排序、筛选查找特定模型,点击单条可切换「免费额度用完即停」开关,或查看模型详情抽屉。
页面上方提供批量操作入口,可对所选模型批量开启或批量关闭「免费额度用完即停」,也可一键开启/关闭所有模型;操作前会弹出确认提示,操作完成后展示成功与失败结果,完成后可退出批量操作。
在控制台查看免费额度使用情况
- 进入免费额度页面,选择模型类型页签查看各模型的免费额度使用情况。
- 在全部模型表格中,可通过搜索、排序、筛选等方式查找特定模型,并可切换免费额度用完即停开关或使用批量操作功能管理免费额度设置。
查看模型用量
在模型用量页面查看。数据按业务空间维度统计,数据延迟约为 1 小时。
-
进入页面后,选择对应的模型类型(如大语言模型)页签,再按需选择时间范围。页面将汇总展示所选时间段内,该推理类型下所有已调用过模型的用量。
统计时间范围:不支持查看30天以前的统计数据。如需查询更早的用量信息,请通过页面查询。
按推理类型筛选:仅「大语言模型」页签支持按推理类型(实时推理 或 批量推理)筛选;若该空间下从未产生过「批量推理」用量数据,推理类型下拉框只会显示「实时推理」。
时间精度:支持按分钟、小时、天三种精度查看。时间跨度超过 1 天时分钟精度不可选,超过 7 天时仅支持按天查看。
按 API-KEY 筛选:可通过 API-KEY 下拉框筛选指定 API Key 调用产生的用量。
-
如需查询某个具体模型的用量,可在页面右侧搜索框输入模型名称(如
qwen-plus)筛选对应数据。可前往模型列表查询模型名称。
- 页面底部「总调用成功次数 Top 10 模型」区域汇总展示调用次数最多的 10 个模型,支持全屏查看和下载数据。
- 点击单行查看详情,进入模型用量详情页查看该模型更细粒度的调用趋势。
- 筛选条件较多时可用重置清空,并按需收起/展开筛选区域。
- 「概览」页签以指标卡片汇总关键用量;「更多指标」页签可切换不同用量维度的趋势图。
查看费用概览
在费用概览页面,可查看百炼服务的费用汇总信息,包括:
- 费用卡片:展示当前账期的总消费金额、订阅购买费用和账单费用,并可跳转查看明细。
- 账单趋势:以图表或列表形式展示费用趋势,支持按月或按天统计,可按产品分类、API Key ID、模型筛选。
- 费用告警:可设置费用告警,在费用异常时及时收到通知。
模型用量统计单位说明
在阿里云百炼,不同模型的用量统计口径如下:
类型 | 二级分类 | 统计单位 | 计费说明(模型调用) |
|---|---|---|---|
大语言模型 | 按输入和输出对应的 Token 数计费。 | ||
视觉模型 | 张 | 按成功生成的 图像张数计费。 | |
视频生成 | 秒 | 按成功生成的 视频秒数 计费。 | |
语音模型 | 秒、字符或 Token | 可能按音频时长(秒)、对应的文本字符数或 Token 数计费,视模型而定。 | |
全模态模型 | Token | 文本部分按 Token 数,其他模态(音频、图像、视频)按对应的 Token 数计费。 | |
向量模型 | Token | 按输入文本的 Token 数计费。 | |
文本向量模型 |
应用于生产环境
管理模型用量建议:
- 控制模型输出长度: 在调用模型 API 时,合理限制思考长度和设置
max_tokens参数,可限制模型单次生成内容的最大长度(从而控制费用)。 - 根据任务类型选择模型: 对于分类、摘要等简单任务,优先选择成本更低的轻量级模型,而不是始终使用功能强大但价格也较高的模型。
- 监控与告警: 通过模型监控监控用量趋势,并可配置用量告警,当用量出现异常时及时收到通知。
- 优化 Prompt: 简洁、清晰的 Prompt 不仅能提升模型输出质量,也能减少不必要的输入 Token 消耗。
- 使用批量推理: 对于非实时、大批量的处理任务,使用批量推理通常比实时调用更具成本优势。
名词解释
名词 | 解释 |
|---|---|
Token | 大模型以 Token 为单位处理输入和输出。一个 Token 可能是:
根据经验,平均1个汉字约对应 1.5-2 个 Token;1 个英文字母约对应 0.25 个 Token;1 个英文单词约对应 1.3 个 Token:
每个模型都有最大输入和输出 Token 数(详见模型列表),超过限制会导致请求失败。 |
实时推理 | 指对模型的所有直接和间接调用,主要涵盖以下场景:
|
批量推理 | 对于无需实时响应的场景,通过OpenAI兼容-Batch(文件输入)接口以离线方式进行的大规模数据处理。 |