独占吞吐DTU(Dedicated Throughput Unit)以独占部署方式为指定模型提供性能和吞吐保障,按输入/输出 TPM(Tokens Per Minute,每分钟 token 数)售卖。本文介绍 DTU 的功能、计费方式、使用流程与支持模型。
产品概述
DTU(Dedicated Throughput Unit,独占吞吐)以独占部署方式为指定模型提供性能和吞吐保障,按 Input/Output TPM 售卖,支持基础模型与自定义模型。DTU 提供全托管推理服务,底层独占 GPU 资源,由平台负责运维。
DTU 是模型单元(Model Unit,MU)的继任方案:在保留 MU 独占算力、资源隔离与可部署微调模型等能力的同时,将计量粒度由模型单元数量调整为输入/输出 TPM,提供更直接的吞吐保障。新购独占部署建议优先选择 DTU。
- 独占 GPU 资源,推理环境与其他用户物理隔离。
- 支持基础模型和自定义模型(百炼微调模型或用户上传模型)部署。
- 按性能档位选购,平台负责底层运维,无需管理 GPU。
- 不主动设 RPM/TPM 上限,流量受实际承载力限制。
方案选型
百炼为推理调用提供多种容量与计费方案。DTU 适用于需要独占部署、微调模型部署、低延迟高并发或数据隔离的场景。各方案的对比如下表所示。
Token 按量和 PTU 部署详见模型部署。
对比维度 | DTU | PTU | Token 按量 | PAI/灵骏 |
|---|---|---|---|---|
特点 | 独占算力 + 微调模型 | 吞吐保障 + 低延迟 | 弹性灵活、零门槛 | 自定义运行时 |
资源隔离 | 物理隔离 | 逻辑隔离 | 共享公池 | 物理隔离 |
微调模型 | 全参 + LoRA | 不支持 | LoRA | 支持 |
自定义框架 | 不支持 | 不支持 | 不支持 | 支持 |
计费模式 | TPM 额度 × 时长 | TPM 额度 × 时长 | Token 用量 | GPU × 时长 |
计费说明
DTU 按输入 TPM 和输出 TPM 分别计费,采用预付费(按月)模式。各模型有固定的输入/输出基准 TPM(见下表),购买时需为基准 TPM 的整数倍。输入和输出各至少购买基准 TPM(1 倍),生产环境建议各购买 2 倍以上。
费用由后端根据模型、输入/输出 TPM、服务区域和购买时长计算。各模型的输入/输出单价与月总价如下表所示,输入/输出单价按 kTPM·月计价,月总价为输入输出各 1 倍基准 TPM 的合计,微调模型的价格与对应基础模型相同,具体以控制台实际展示为准。
部署相同模型,规格性能排序为:Fast > Efficient > Standard。
- 新加坡
模型 | 基准输入(TPM) | 基准输出(TPM) | 输入单价(USD/kTPM·月) | 输出单价(USD/kTPM·月) | 月总价(USD) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 1,192,000 | 148,000 | 37 | 295 | 87,764 |
1,372,000 | 170,000 | 32 | 257 | 87,594 | |
660,000 | 124,000 | 66 | 352 | 87,208 | |
704,000 | 132,000 | 62 | 331 | 87,340 |
以下性能参考数据均在缓存命中率为 0% 的条件下测得。实际使用中,随着缓存命中率提升,模型性能也会相应提高。
模型 | 输入长度 | 输出长度 | 缓存命中率 | 首字延迟(ms) | 每token延迟(ms) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 16,000 | 2,000 | 0 | 888 | 10 |
16,000 | 2,000 | 0 | 2,418 | 15 | |
2,600 | 500 | 0 | 819 | 14 | |
2,600 | 500 | 0 | 970 | 13 |
创建部署
使用 DTU 前需在控制台开通 DTU 功能并申请资源额度。开通后在百炼控制台模型部署页面选择目标模型,计费方式选择 DTU 即可创建部署。
通用模型部署的基础流程详见模型部署文档。
创建部署的表单字段如下表所示。
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
服务名称 | 部署服务的名称 | 是 | 自定义 |
模型 | 部署的目标模型 | 是 | 下拉选择 |
部署模版 | 部署架构 | 否 | 下拉选择,默认选第一个 |
付费类型 | 计费方式 | 是 | 预付费(按月) |
输入吞吐额度 | 购买的输入 TPM 容量 | 是 | 基准输入 TPM 的整数倍(kTPM) |
输出吞吐额度 | 购买的输出 TPM 容量 | 是 | 基准输出 TPM 的整数倍(kTPM) |
购买时长 | 购买周期 | 是 | 1-12(整数,月) |
自动续费 | 到期自动续费 | 否 | 开/关 |
单次续费时长 | 开启自动续费时必填 | 是 | 1-12(整数,月) |
容量规划
DTU 按输入/输出 TPM 售卖,所购 TPM 即每分钟可处理的最大 token 量。容量规划的目标是:依据业务峰值 token 需求推算需购买的倍数,再通过压测验证实际可承载的并发与延迟是否达标。各模型的基准输入/输出 TPM 与标准工况性能参考见上方表格。
建议使用 evalscope 等压测工具,按真实业务场景(输入/输出长度、并发数、延迟要求)压测,再对照定价表确定购买倍数。
容量规划方法
- 梳理业务峰值指标:典型请求的输入/输出 token 长度、目标并发数,以及对首字延迟(TTFT)和每 token 生成延迟(TPOT)的要求。
- 估算峰值吞吐需求:峰值输入 TPM ≈ 并发数 × 单请求输入长度 ÷ 单请求处理时长(分钟);峰值输出 TPM ≈ 并发数 × 单请求输出长度 ÷ 单请求生成时长(分钟)。
- 计算购买倍数:输入倍数 = ⌈峰值输入 TPM ÷ 基准输入 TPM⌉,输出倍数 = ⌈峰值输出 TPM ÷ 基准输出 TPM⌉;DTU 输入与输出需同增同减,取两者较大值作为最终倍数。
- 压测验证:按计算倍数购买后,用 evalscope 在目标工况下复测,确认实际吞吐与延迟满足业务要求。若延迟偏高,可在 TPM 余量内提高并发以提升有效吞吐。