Skip to main content
开始使用

限流

百炼按主账号维度对模型调用设置限流,账号下所有RAM子账号、业务空间和API Key 的调用量合并计算。超出限制时请求会被拒绝,通常在一分钟内自动恢复。

限流规则

  • 账号级别限流:限流按主账号维度计算,账号下所有RAM子账号、业务空间和API Key 的调用量合并计算。
  • 模型独立限流:不同模型限流额度相互独立,具体参见下方表格。

FAQ

为什么触发限流?

根据错误信息判断触发了哪类限流:
  • Requests rate limit exceededYou exceeded your current requests list:触发了每分钟请求数(RPM)限流。
  • Allocated quota exceededYou exceeded your current quota:触发了每分钟 Token 消耗(TPM)限流。
  • Request rate increased too quickly:请求频率在短时间内激增,触发了系统稳定性保护——即使总调用量未达到 RPM 或 TPM 上限也会触发。
  • 其他报错,参见错误码确认原因。
除 RPM 和 TPM 外,限流策略可能按秒级 RPS(RPM/60)与 TPS(TPM/60)执行。即使每分钟总调用量未超限,短时间内的请求爆发也可能触发限流。

如何查看模型调用量?

模型调用完一小时后,在模型监控(新加坡北京)页面设置查询条件(例如,选择时间范围、业务空间等),再在模型列表区域找到目标模型并单击操作列的监控,即可查看该模型的调用统计结果。具体请参见模型监控文档。
数据按小时更新,高峰期可能有小时级延迟,请您耐心等待。
image

遇到限流后多久恢复?

通常在一分钟内恢复。如出现其他报错,参见错误码进行处理。

模型响应速度与付费有关吗?

模型输出速度与是否付费无关。免费额度和付费调用使用相同的模型服务基础设施,同一模型的生成速度相同。免费额度仅控制请求是否被接受——额度耗尽时返回 403 错误(开通免费额度用完即停后),不会降低已接受请求的生成速度。

什么因素影响模型响应速度?

  • 模型类型:轻量模型(如 qwen-flash)比大型模型(如 qwen-max)生成更快。
  • 输出长度:输出 Token 越多,总耗时越长。
  • 服务器负载:高峰期可能略有波动。

限流会降低已接受请求的生成速度吗?

不会。限流(RPM/TPM)仅导致超出限制的请求被拒绝(返回 429 错误)。免费额度耗尽时(开通免费额度用完即停)返回 403 错误,同样不影响已接受请求的速度。429 为速率限制,403 为配额耗尽,两者均为拒绝机制。

如何避免限流?

  1. 选用高限流模型:稳定版或最新版比带日期的快照版本限流更宽松。
  2. 优化调用策略
    • 降低调用频率:收到 Requests rate limit exceededYou exceeded your current requests list 时,降低API调用频率。
    • 减少 Token 消耗:收到 Allocated quota exceededYou exceeded your current quota 时,缩短输入或限制输出长度。
    • 平滑请求速率:收到 Request rate increased too quickly 时,采用匀速调度、指数退避或请求队列将请求均匀分散,避免瞬时高峰。
  3. 添加备选模型 触发限流后切换到备用模型继续生成,可降低失败概率、提升吞吐量。以下代码在调用 qwen-plus-2025-07-28 触发限流后,自动改用 qwen-plus-2025-07-14 重试。也可以选择不同系列的模型(如 qwen-flash)作为备选模型,进一步降低主备模型同时限流的风险。
    import os
    import asyncio
    from openai import AsyncOpenAI, APIStatusError
    
    # 配置
    API_KEY = os.getenv("DASHSCOPE_API_KEY")
    # 主用模型
    MODEL = "qwen-plus-2025-07-28"
    # 备选模型
    BACKUP_MODEL = "qwen-plus-2025-07-14"
    # 测试问题
    QUESTION = "你是谁?"
    # 并发设置
    NUM_REQUESTS = 10
    
    client = AsyncOpenAI(
        api_key=API_KEY,
        # 调用时请将WorkspaceId替换为真实的业务空间ID
        base_url="https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1"
    )
    
    async def send_request(model):
        """发送单个请求"""
        try:
            await client.chat.completions.create(
                model=model,
                messages=[{"role": "user", "content": QUESTION}]
            )
            return True
        except APIStatusError as e:
            if e.status_code == 429:
                print(f"[限流触发] 模型 {model}")
                return False
            raise
        except Exception as e:
            print(f"[请求失败] 模型 {model},错误:{e}")
            return False
    
    async def task(i):
        # 尝试主模型
        if await send_request(MODEL):
            return True
        # 限流时尝试备用模型
        return await send_request(BACKUP_MODEL)
    
    async def main():
        results = await asyncio.gather(*(task(i) for i in range(NUM_REQUESTS)))
        print(f"成功请求: {sum(results)}, 失败请求: {len(results) - sum(results)}")
    
    if __name__ == "__main__":
        asyncio.run(main())
    
  4. 拆分任务:长对话或大型文档会快速消耗大量 Token。将大批量任务拆分为小批次,分时段提交。
  5. 批量推理:无需实时响应时,使用批量推理(Batch API)。批量请求不受实时限流约束,但需考虑排队和处理时间。
  6. 提升限流额度:默认限流额度不足时,在百炼控制台的限流提额页面提升模型的临时 TPM 额度,提交后立即生效。详见提升临时限流额度

如何控制 Token 用量或费用支出?

限流仅约束单位时间内的调用速率,不限制累计用量。如需控制 Token 用量或费用支出,可通过以下方式管理:
  • 设置消费限额与费用告警:在账单费用卡片设置费用告警,开启月度消费限额并配置阈值通知,达到阈值即提醒,避免超额支出。详见账单查询与成本管理
  • 开启免费额度用完即停:对支持免费额度的模型,可开启免费额度用完即停,免费额度耗尽后自动停止调用,避免产生额外费用。详见新人免费额度
  • 监控模型调用量:定期查看各模型的 Token 用量,及时发现异常增长,参见上文如何查看模型调用量?

充值后是否还会被限流?

充值不改变模型默认的 RPM 和 TPM 限流阈值。限流按阿里云主账号维度配置,与计费相互独立;充值(按量付费)仅确保账号不因欠费停服,不会提升限流值。 如需更高的限流额度,请参见本文如何避免限流?,或在百炼控制台的限流提额页面申请提升临时限流额度

提升临时限流额度

默认限流额度不足时,可在百炼控制台提升模型的临时 TPM 额度。 目前支持华北2(北京)和新加坡地域。
  1. 登录百炼控制台,进入限流提额页面。
  2. 单击页面右上角的提升模型临时限流额度
  3. 在弹窗中选择模型,填写期望的 Token 账号限流(Token/60 秒)值。弹窗中会显示当前额度和可设置上限。
  4. 单击确定,提额立即生效。
提额生效后,可通过以下方式确认:
  • 限流提额页面的列表中,查看已提额的模型及对应限流数据。
  • 模型列表中进入对应模型的详情页,查看更新后的限流数据。
  • 支持临时提额的模型以限流提额页面弹窗的可选列表为准。
  • 对已提额的模型再次提交视为重新申请,有效期随之重置为 30 天。
  • 按实际需求申请额度。若配置容量长期显著超过实际使用量,系统可能在提前通知后将其恢复为默认值。
  • 若限流额度不满足需求,请联系商务经理申请提额。

文本生成-千问

千问语言模型

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 中国香港
  • 日本(东京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.8-max
qwen3.8-max-0902国际1,500250,000
国际15,0002,000,000
qwen3.8-max-0902国际15,000150,000
qwen3.8-flash国际15,0002,000,000
qwen3.7-max国际6001,000,000
qwen3.7-max-2026-06-08国际601,000,000
qwen3.7-max-2026-05-20国际601,000,000
qwen3.7-max-preview国际6001,000,000
qwen3.7-max-2026-05-17国际6001,000,000
qwen3.6-max-preview国际6001,000,000
qwen3-max国际6001,000,000
qwen3-max-2026-01-23国际6001,000,000
qwen3-max-2025-09-23国际60100,000
qwen3-max-preview国际6001,000,000
qwen-max
Batch API调用服务时,不受限流限制。
国际6001,000,000
qwen3.7-plus国际15,0005,000,000
qwen3.7-plus-2026-05-26国际601,000,000
qwen3.6-plus国际15,0005,000,000
qwen3.6-plus-2026-04-02国际601,000,000
qwen3.7-flash国际15,0005,000,000
qwen3.7-flash-2026-07-15国际15,0005,000,000
qwen3.6-flash国际15,0005,000,000
qwen3.6-flash-2026-04-16国际601,000,000
qwen3.5-plus国际15,0005,000,000
qwen3.5-plus-2026-04-20国际6001,000,000
qwen3.5-plus-2026-02-15国际601,000,000
qwen-plus
Batch API调用服务时,不受限流限制。
国际6001,000,000
qwen-plus-latest国际6001,000,000
qwen-plus-2025-12-01国际1201,000,000
qwen-plus-2025-09-11国际1201,000,000
qwen-plus-2025-07-28国际60100,000
qwen-plus-2025-07-14(qwen-plus-0714)国际60100,000
qwen-plus-2025-04-28(qwen-plus-0428)国际601,000,000
qwen-plus-2025-01-25(qwen-plus-0125)国际60100,000
qwen3.5-flash国际15,0005,000,000
qwen3.5-flash-2026-02-23国际601,000,000
qwen-flash
Batch API调用服务时,不受限流限制。
国际6005,000,000
qwen-flash-2025-07-28国际6005,000,000
qwq-plus国际60100,000
qwen-turbo
Batch API调用服务时,不受限流限制。
国际6005,000,000

千问VL(视觉理解/图生文)

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 中国香港
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-vl-plus国际1,2001,000,000
qwen3-vl-plus-2025-12-19国际60100,000
qwen3-vl-plus-2025-09-23国际1201,000,000
qwen3-vl-flash国际1,2001,000,000
qwen3-vl-flash-2026-01-22国际60100,000
qwen3-vl-flash-2025-10-15国际1201,000,000
qwen-vl-max国际1,2001,000,000
qwen-vl-plus国际1,2001,000,000
qvq-max国际60100,000

千问Omni(全模态)

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-omni-flash国际60100,000
qwen3.5-omni-flash-2026-03-15国际60100,000
qwen3.5-omni-plus国际60100,000
qwen3.5-omni-plus-2026-03-15国际60100,000
qwen3-omni-flash国际60100,000
qwen3-omni-flash-2025-12-01国际60100,000
qwen3-omni-flash-2025-09-15国际60100,000
qwen-omni-turbo国际60100,000
qwen-omni-turbo-latest国际60100,000
qwen-omni-turbo-2025-03-26国际60100,000

千问Omni-Realtime(实时多模态)

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-omni-plus-realtime国际60100,000
qwen3.5-omni-plus-realtime-2026-03-15国际60100,000
qwen3.5-omni-flash-realtime国际60100,000
qwen3.5-omni-flash-realtime-2026-03-15国际60100,000
qwen3-omni-flash-realtime国际60100,000
qwen3-omni-flash-realtime-2025-12-01国际60100,000
qwen3-omni-flash-realtime-2025-09-15国际60100,000
qwen-omni-turbo-realtime国际6010,000
qwen-omni-turbo-realtime-latest国际6010,000
qwen-omni-turbo-realtime-2025-05-08国际6010,000

千问OCR(文字提取)

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-vl-ocr国际6006,000,000
qwen-vl-ocr-2025-11-20国际1,2006,000,000

千问数学模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-math-plus1,2001,000,000
qwen-math-plus-latest1,2001,000,000
qwen-math-plus-2024-09-19(qwen-math-plus-0919)60100,000
qwen-math-plus-2024-08-16(qwen-math-plus-0816)1020,000
qwen-math-turbo12001,000,000

千问Coder

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-coder-plus国际2,4002,000,000
qwen3-coder-plus-2025-09-23国际6001,000,000
qwen3-coder-plus-2025-07-22国际601,000,000
qwen3-coder-flash国际6005,000,000
qwen3-coder-flash-2025-07-28国际6005,000,000

千问翻译模型

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-mt-plus国际60100,000
qwen-mt-flash国际60100,000
qwen-mt-lite国际60100,000
qwen-mt-turbo国际60100,000

千问数据挖掘模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-doc-turbo6003,000,000

千问深入研究模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-deep-research1201,200,000

文本生成-千问-开源版

千问语言模型开源版

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.8-2.4t-a95b国际5,0005,000,000
qwen3.8-27b国际5,0005,000,000
qwen3.6-35b-a3b国际6001,000,000
qwen3.6-27b国际6001,000,000
qwen3.5-397b-a17b国际6001,000,000
qwen3.5-122b-a10b国际6001,000,000
qwen3.5-27b国际6001,000,000
qwen3.5-35b-a3b国际6005,000,000
qwen3-next-80b-a3b-thinking国际6001,000,000
qwen3-next-80b-a3b-instruct国际6001,000,000
qwen3-235b-a22b-thinking-2507国际6001,000,000
qwen3-235b-a22b-instruct-2507国际6001,000,000
qwen3-30b-a3b-thinking-2507国际6005,000,000
qwen3-30b-a3b-instruct-2507国际6005,000,000
qwen3-235b-a22b国际6001,000,000
qwen3-32b国际6001,000,000
qwen3-30b-a3b国际6001,000,000
qwen3-14b国际6001,000,000
qwen3-8b国际6001,000,000

Qwen-VL(视觉理解/图生文)

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-vl-32b-thinking国际60100,000
qwen3-vl-32b-instruct国际60100,000
qwen3-vl-30b-a3b-thinking国际60100,000
qwen3-vl-30b-a3b-instruct国际60100,000
qwen3-vl-8b-thinking国际60100,000
qwen3-vl-8b-instruct国际60100,000
qwen3-vl-235b-a22b-thinking国际60100,000
qwen3-vl-235b-a22b-instruct国际60100,000

Qwen3-Omni

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen2.5-omni-7b国际60100,000

Qwen3-Omni-Captioner

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-omni-30b-a3b-captioner国际60100,000

Qwen-Coder

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-coder-next国际6001,000,000
qwen3-coder-480b-a35b-instruct国际6001,000,000
qwen3-coder-30b-a3b-instruct国际6001,000,000

文本生成-第三方模型

DeepSeek

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 日本(东京)
  • 中国香港
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
deepseek-v4-pro国际10,0001,200,000
deepseek-v4-pro-0813国际10,0001,200,000
deepseek-v4-flash-0731国际15,0001,200,000
deepseek-v4-flash国际10,0001,200,000
deepseek-v3.2国际10,0001,200,000

Kimi

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 德国(法兰克福)
  • 中国香港
  • 日本(东京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
kimi-k315,0001,200,000
kimi-k2.7-code5001,000,000
kimi-k2.65001,000,000
kimi-k2.55001,000,000
kimi-k2-thinking5001,000,000
Moonshot-Kimi-K2-Instruct5001,000,000

MiniMax

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
MiniMax-M2.55001,000,000

GLM

  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 新加坡
  • 中国香港
  • 日本(东京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
glm-5.2全球5001,000,000
glm-5.2-us美国5001,000,000
glm-5.1全球5001,000,000

GLM-Z.AI直供

  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
ZHIPU/GLM-5.32003,000,000
ZHIPU/GLM-5.22003,000,000

图像生成

千问(Qwen-Image)

  • 新加坡
  • 华北2(北京)
  • 德国(法兰克福)
  • 中国香港
  • 日本(东京)

模型名称

服务部署范围

限流条件(超出任一数值时触发限流)

任务下发接口调用限制

同时处理中任务数量(并发数)

qwen-image-3.0-pro

国际

5 次/分钟

同步接口无限制 / 异步接口 10

qwen-image-3.0

国际

20 次/分钟

同步接口无限制 / 异步接口 10

qwen-image-2.0-pro

国际

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-06-22

国际

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-04-22

国际

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-03-03

国际

2 次/分钟

同步接口无限制

qwen-image-2.0

国际

2 次/秒

同步接口无限制

qwen-image-2.0-2026-03-03

国际

2 次/秒

同步接口无限制

qwen-image-max

国际

2 次/分钟

同步接口无限制

qwen-image-max-2025-12-30

国际

2 次/分钟

同步接口无限制

qwen-image-plus

国际

2 次/秒

同步接口无限制 / 异步接口 2

qwen-image-plus-2026-01-09

国际

2 次/秒

同步接口无限制

qwen-image

国际

2 次/秒

同步接口无限制 / 异步接口 2

qwen-image-edit-max

国际

2 次/分钟

同步接口无限制

qwen-image-edit-max-2026-01-16

国际

2 次/分钟

同步接口无限制

qwen-image-edit-plus

国际

2 次/秒

同步接口无限制

qwen-image-edit-plus-2025-12-15

国际

2 次/秒

同步接口无限制

qwen-image-edit-plus-2025-10-30

国际

2 次/秒

同步接口无限制

qwen-image-edit

国际

2 次/秒

同步接口无限制

qwen-mt-image-2.0

国际

60 次/分钟

2

文生图-Z-Image

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

z-image-turbo

国际

2

同步接口无限制

万相

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)

模型名称

服务部署范围

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

wan2.7-image-pro

国际

5

5

wan2.7-image

国际

5

5

wan2.6-image

国际

5

5

wan2.6-t2i

国际

5

5

wan2.5-t2i-preview

国际

5

5

wan2.2-t2i-flash

国际

2

2

wan2.2-t2i-plus

国际

2

2

wan2.1-t2i-turbo

国际

2

2

wan2.1-t2i-plus

国际

2

2

wan2.5-i2i-preview

国际

5

5

AI试衣OutfitAnyone

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

作业提交接口RPS限制

同时处理中任务数量

aitryon-plus

10

5

aitryon-parsing-v1

10

同步接口无限制

视频生成

HappyHorse系列

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 日本(东京)

模型名称

服务部署范围

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

happyhorse-1.1-t2v

国际

5

5

happyhorse-1.1-i2v

国际

5

5

happyhorse-1.1-r2v

国际

5

5

happyhorse-1.0-t2v

国际

5

5

happyhorse-1.0-i2v

国际

5

5

happyhorse-1.0-r2v

国际

5

5

happyhorse-1.0-video-edit

国际

5

5

万相系列

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • 德国(法兰克福)
  • 日本(东京)
  • 中国香港

模型名称

服务部署范围

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

wan3.0-video-prime

国际

5

5

wan3.0-video

国际

5

5

wan2.7-t2v-2026-06-12

国际

5

5

wan2.7-t2v-2026-04-25

国际

5

5

wan2.7-t2v

国际

5

5

wan2.6-t2v

国际

5

5

wan2.5-t2v-preview

国际

5

5

wan2.2-t2v-plus

国际

2

2

wan2.1-t2v-turbo

国际

2

2

wan2.1-t2v-plus

国际

2

2

wan2.7-i2v-2026-04-25

国际

5

5

wan2.7-i2v

国际

5

5

wan2.6-i2v-flash

国际

5

5

wan2.6-i2v

国际

5

5

wan2.5-i2v-preview

国际

5

5

wan2.2-i2v-flash

国际

2

2

wan2.1-i2v-plus

国际

2

2

wan2.1-i2v-turbo

国际

2

2

wan2.2-i2v-plus

国际

2

2

wan2.2-kf2v-flash

国际

2

2

wan2.1-kf2v-plus

国际

1

2

wan2.1-vace-plus

国际

2

2

wan2.7-videoedit

国际

5

5

wan2.7-r2v

国际

5

5

wan2.6-r2v-flash

国际

5

5

wan2.6-r2v

国际

5

5

wan2.2-animate-move

国际

5

1

wan2.2-animate-mix

国际

5

1

舞动人像AnimateAnyone

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

animate-anyone-detect-gen2

5

同步接口无限制

animate-anyone-template-gen2

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

animate-anyone-gen2

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

悦动人像EMO

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

emo-detect-v1

5

同步接口无限制

emo-v1

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

灵动人像LivePortrait

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

liveportrait-detect

5

同步接口无限制

liveportrait

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

声动人像VideoRetalk

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

videoretalk

1

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

表情包Emoji

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

emoji-detect-v1

1

同步接口无限制

emoji-v1

1

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

视频风格重绘

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

video-style-transform

20

2

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

音乐生成

  • 华北2(北京)

模型名称

每分钟调用次数(RPM)

fun-music-preview

180

fun-music-v1

180

语音对话

实时语音对话

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-audio-3.0-realtime-plus国际60100,000
qwen-audio-3.0-realtime-flash国际60100,000

语音合成(文本转语音)

Qwen-Audio-TTS

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

提交作业接口RPS限制

qwen-audio-3.0-tts-plus

国际

3

qwen-audio-3.0-tts-flash

国际

3

Qwen-TTS

  • 新加坡
  • 华北2(北京)
  • Qwen3-TTS-Instruct-Flash
  • Qwen3-TTS-VD
  • Qwen3-TTS-VC
  • Qwen3-TTS-Flash

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen3-tts-instruct-flash

国际

180

qwen3-tts-instruct-flash-2026-01-26

国际

180

Qwen-TTS-Realtime

  • 新加坡
  • 华北2(北京)
  • Qwen3-TTS-Instruct-Flash-Realtime
  • Qwen3-TTS-VD-Realtime
  • Qwen3-TTS-VC-Realtime
  • Qwen3-TTS-Flash-Realtime

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen3-tts-instruct-flash-realtime

国际

180

qwen3-tts-instruct-flash-realtime-2026-01-22

国际

180

Qwen-TTS声音复刻

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen-voice-enrollment

国际

180

Qwen-TTS声音设计

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen-voice-design

国际

180

CosyVoice

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

提交作业接口RPS限制

cosyvoice-v3-plus

国际

3

cosyvoice-v3-flash

国际

Qwen-Audio-TTS/CosyVoice声音复刻/设计

Qwen-Audio-TTS/CosyVoice声音复刻/设计共用一个模型,共用限流额度。
  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

提交作业接口RPS限制

voice-enrollment

国际

10

语音识别(语音转文本)与翻译(语音转成指定语种的文本)

Qwen3-LiveTranslate-Flash

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-livetranslate-flash国际100100,000
qwen3-livetranslate-flash-2025-12-01国际100100,000

Qwen-LiveTranslate-Flash-Realtime

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-livetranslate-flash-realtime国际10100,000
qwen3.5-livetranslate-flash-realtime-2026-05-19国际
qwen3-livetranslate-flash-realtime国际
qwen3-livetranslate-flash-realtime-2025-09-22国际

Qwen-Audio-3.0-ASR-Flash-Streaming

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

提交作业接口RPS限制

qwen-audio-3.0-asr-flash-streaming

国际

20

Qwen-Audio-3.0-ASR-Flash-Filetrans

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen-audio-3.0-asr-flash-filetrans

国际

600

Qwen-Audio-3.0-ASR-Flash

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen-audio-3.0-asr-flash

国际

600

Qwen-ASR

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
  • Qwen3-ASR-Flash-Filetrans
  • Qwen3-ASR-Flash

模型名称

服务部署范围

每分钟调用次数(RPM)

qwen3-asr-flash-filetrans

国际

100

qwen3-asr-flash-filetrans-2025-11-17

国际

Qwen-ASR-Realtime

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每秒钟调用次数(RPS)

qwen3-asr-flash-realtime

国际

20

qwen3-asr-flash-realtime-2026-02-10

国际

qwen3-asr-flash-realtime-2025-10-27

国际

Paraformer

  • 华北2(北京)

模型名称

提交作业接口RPS限制

paraformer-realtime-v2

20

paraformer-realtime-8k-v2

模型名称

每分钟调用次数(RPM)

paraformer-v2

1,200

模型名称

提交作业接口RPS限制

同时处理中任务数量(并发数)

paraformer-8k-v2

20

100

Fun-ASR

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

每分钟调用次数(RPM)

fun-asr

国际

600

fun-asr-2025-11-07

国际

600

fun-asr-2025-08-25

国际

600

fun-asr-mtl

国际

100

fun-asr-mtl-2025-08-25

国际

100

fun-asr-flash-2026-06-15

国际

600

Fun-ASR-Realtime

  • 新加坡
  • 华北2(北京)

模型名称

服务部署范围

提交作业接口RPS限制

fun-asr-realtime

国际

20

fun-asr-realtime-2025-11-07

国际

文本向量

  • 新加坡
  • 华北2(北京)
  • 中国香港
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.7-text-embedding国际24,0001,000,000
text-embedding-v4国际1,8001,000,000
text-embedding-v3国际6,00024,000,000

多模态向量

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
仅输入Token
tongyi-embedding-vision-plus国际600200,000
tongyi-embedding-vision-flash国际600200,000

排序模型

  • 新加坡
  • 华北2(北京)
模型名称服务部署范围限流条件
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
仅输入Token
qwen3-rerank国际5,4005,000,000,000

行业

意图理解

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
tongyi-intent-detect-v31,2001,000,000

角色扮演

  • 新加坡
  • 美国(弗吉尼亚)
  • 华北2(北京)
模型名称服务部署范围限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-plus-character国际120500,000
qwen-flash-character国际120500,000
qwen-plus-character-ja国际120500,000

已下线模型

详细信息,请参见 模型下线机制说明
  • 2026年1月30日下线
  • 2025年8月20日下线
类别模型名称限流条件(超出任一数值时触发限流)
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
千问Plusqwen-plus-2024-11-2700
qwen-plus-2024-11-25
qwen-plus-2024-09-19
qwen-plus-2024-08-06
千问Turboqwen-turbo-2024-09-19
千问VLqwen-vl-max-2024-10-30
qwen-vl-max-2024-08-09
qwen-vl-plus-2024-08-09
Token Plan
模型体验
  • 音乐生成
用量统计与性能监控
资产中心
服务支持