按模型 Token 使用量计费的部署方式,仅支持 LoRA 微调模型,不使用不计费,适用于调优后模型效果验证及对并发和延迟要求不高的低成本场景。
概述
按 Token 用量计费(不使用不计费),仅支持部分经过 LoRA 高效微调的模型,适用于调优后模型效果验证及对并发和延迟要求不高的低成本场景。该模式下吞吐/并发和生成速度均由平台预置,用户不可调。
计费方式在服务创建后无法更改。如需切换,必须下线已部署模型后重新部署,详见模型部署简介。
计费规则
费用 = 模型输入 Token 数 × 模型输入单价 + 模型输出 Token 数 × 模型输出单价(最小计费单位:1 token)
- 仅当对下列基础模型完成 SFT 高效训练(即 LoRA 高效微调,API 部署时 plan 取值为 lora)并得到自定义模型后,才支持按模型 Token 使用量计费。
支持模型与价格
- 新加坡
- 北京
基础模型 | 模型代码 | 输入 $/百万Token | 输出 $/百万Token |
|---|---|---|---|
Qwen3-14B | qwen3-14b | 非思考模式:$0.35 思考模式:$0.35 | 非思考模式:$1.4 思考模式:$4.2 |
LoRA 部署
Token 按量部署仅支持 LoRA 微调模型,API 创建时 plan 取值为 lora。capacity 参数设置无效但必须填写;如需扩缩容,请前往百炼专属部署控制台填写表单申请。
通过 API 创建部署的完整示例见API 部署指南。
扩容
按 Token 用量计费的部署,扩容需在控制台提交申请表单,等待人工审核,不支持自助扩缩容。
常见问题
Q: 一个月不使用会怎样?
Q: 一个月不使用会怎样?
按 Token 用量计费的部署,一个月内不使用将自动释放。
Q: 如何切换到其他计费方式?
Q: 如何切换到其他计费方式?
只能下线原有资源,再通过需要的计费方式创建新资源。详见模型部署简介。